[AI 인프라 구축 사례] 고밀도 액체냉각으로 완성한 홀리데이로보틱스의 고성능 AI 개발 환경
프롤로그: 본격적인 AI 인프라 구축의 시작점에서
홀리데이로보틱스는 2013년 산업용 AI 비전 기업 수아랩을 창업해 매각까지 이끌었던 송기영 대표가 다시 세운 피지컬 AI 스타트업입니다. MIT·서울대·KAIST·삼성전자 출신 인재들로 구성된 약 70명 규모의 연구·엔지니어링·사업개발팀이 제조 현장 투입용 휴머노이드 로봇 '프라이데이(FRIDAY)'를 개발하고 있으며, 2026년 연 100대 생산을 시작으로 2027년에는 연 1,000대 규모로 생산을 확장할 계획입니다. 장기적으로는 연 1만 대 생산이 가능한 인프라 구축을 계획하고 있습니다.
빠르게 커지는 양산 계획만큼, 로봇 제어를 위한 AI 모델 학습 역량도 함께 갖춰야 했습니다. 그리고 올해 초 1550억의 대규모 시리즈A 투자를 유치하면서, 회사는 본격적인 GPU 인프라 구축에 나서게 됩니다.
1. 도입 전: 스타트업에게 필요한 건 빠른 AI 개발 환경 구성과 확장성
막 성장하기 시작한 스타트업에게 인프라 구축은 오래 고민하고 설계할 여유가 없는 과제입니다. 연구는 당장 시작해야 했고, 처음부터 대규모로 갖추기보다는 필요한 만큼 빠르게 시작해서 상황에 맞춰 단계적으로 늘려갈 수 있는 구조가 필요했습니다.
개별 부품을 사서 조합하거나 별도 냉각 설비까지 새로 갖추는 방식은 시간이 오래 걸릴 뿐더러, 조직이 빠르게 커지는 과정에서 규모를 다시 설계해야 할 가능성이 있었습니다. 반면 관리가 쉬운 올인원 구조는 별도 시설 없이 바로 가동할 수 있고, 필요할 때마다 대수를 늘려가기도 쉬워 도입 속도와 확장성 두 가지 기준을 동시에 만족 시켰습니다.
이런 기준으로 여러 업체를 비교했지만, 이 과정에서 가격은 결정적인 요인이 아니었습니다. 오히려 결정을 이끈 것은 냉각 시스템의 통합된 구조에 대한 신뢰였습니다. 여러 냉각 솔루션 업체를 비교하는 과정에서, 서울대 슈퍼컴퓨터 ‘천둥’을 만든 연구진들이 개발한 제품이라는 점에서 더욱 신뢰할 수 있었습니다.
빠르게 시작하고 필요한 만큼 늘려갈 수 있는 선택 — 이 판단은 이후 반년 만에 연구 인력이 3배 이상 늘어나며 고성능 AI 서버 대수를 단계적으로 확장해가는 과정에서 그대로 증명됩니다.
2. 매니코어소프트의 해법: 고밀도 액체냉각으로 완성한 하이브리드 GPU 클러스터
매니코어소프트는 2026년 4월 제안을 시작으로 5월 첫 서버(RTX 5090 GPU 10장 탑재)를 공급하며 홀리데이로보틱스의 고성능 AI 인프라를 구축했습니다. 별도 칠러나 배관 공사 없이 서버 자체에서 냉각 사이클이 완결되는 Self-Contained 액체냉각 구조 덕분에, 별도 서버실이나 공조 설비 없이도 GPU 10장을 하나의 랙마운트 섀시에 안정적으로 담을 수 있었습니다.
일반적인 공랭식 GPU 서버는 GPU를 촘촘히 배치할수록 서로 뿜어내는 열이 중첩되며 냉각 한계에 부딪힙니다. 실제로 비교했던 다른 업체들도 한 서버에 담을 수 있는 GPU 개수는 4대에서 많아야 6대 수준에 그쳤습니다. 특히 고사양 GPU인 RTX 5090은 두께가 두꺼워 일반적인 섀시 구조로는 물리적으로 꽂는 것조차 어려워, 서버 설계 자체를 다시 해야 하는 문제였습니다. 매니코어소프트의 dg5R은 이런 물리적 제약을 액체냉각 구조로 해결해, 경쟁사 대비 두 배에 가까운 밀도인 GPU 10장을 하나의 서버에 안정적으로 담아냈습니다.
1차 도입 후 2개월 만에 추가 발주가 이어질 만큼 만족도는 빠르게 확인됐습니다. 10월에는 서버 전용 GPU인 PRO6000SE 10장 탑재 모델 2대가 추가로 공급되는데, 이는 단순한 증설이 아니라 워크로드 특성에 맞춰 GPU 종류를 조합하는 하이브리드 클러스터로의 확장입니다. 대형 모델 학습에는 HGX B300을, 중간 규모 모델 검증에는 PRO6000을, 높은 연산 처리량이 중요한 시뮬레이션 강화학습에는 RTX 5090을 배치하는 방식으로, 동일한 예산 안에서 GPU 자원을 가장 효율적으로 배분할 수 있는 구조를 만들어가고 있습니다.
한 대의 서버에 GPU 10장을 담은 구성을 고수한 이유도 명확했습니다. GPU를 서버 한 대당 4~8장 수준으로 구성하면 같은 GPU 수를 확보하기 위해 그만큼 더 많은 랙과 자리가 필요하지만, 한 대에 10장을 담을 수 있으면 같은 컴퓨팅 자원을 절반에 가까운 공간으로 해결할 수 있습니다. 인력 증가에 맞춰 계속 인프라를 늘려가야 하는 성장기 스타트업에게는, 이 밀도 차이가 곧 "얼마나 더 오래, 지금 공간에서 버틸 수 있는가"를 결정짓는 요소였습니다.
3. 고객이 얻은 혜택: 별도 시설 없이도 안정적인 성능
① 관리 편의성 — 올인원 워크스테이의 체감 효과
별도 서버실이나 전문 관리 인력 없이도, 설치 즉시 바로 가동할 수 있는 구조는 초기 스타트업에게 실질적인 관리 부담을 크게 낮춰주었습니다. 도입 이후 별도의 운영 이슈 없이 AI 개발 환경에 필요한 컴퓨팅 자원을 안정적으로 확보해왔습니다.
② 별도 냉각 시설 없이도 성능 저하 없음
가장 인상적인 대목은, 서버 냉각실 같은 전용 시설이 전혀 없는 사무실 환경에서도 성능 차이를 느끼지 못했다는 점입니다. 발열이 심한 고성능 GPU를 일반 사무실 환경에서 그대로 풀가동해도, 액체냉각 구조가 열을 안정적으로 잡아준 덕분입니다.
③ 소음 이슈 없음
고성능 GPU 서버 다수를 사무실 한켠에서 상시 가동함에도 불구하고, 업무에 지장을 줄 만한 소음 문제는 전혀 없었습니다.
④ 재구매로 이어진 신뢰
신규 고객이 1차 납품 후 2개월 만에 추가 발주를 진행했고, 10월에는 세 번째 발주까지 이어졌습니다. 공급된 서버 모두 별도 장애 이력 없이 안정적으로 가동 중이라는 점이, 고객이 매니코어소프트를 계속 찾는 이유를 뒷받침합니다.
4. 앞으로의 계획: 성장에 맞춰 계속 확장되는 인프라
연구 인력이 반년 만에 3배 넘게 늘어난 데다, 앞으로 연 100대에서 1,000대 규모로 로봇 양산을 확대할 계획까지 맞물려 있어, 홀리데이로보틱스의 인프라 확장은 이제부터가 본격적인 시작입니다. 특히 현재 사용 중인 공간의 전력 용량이 한계에 가까워지면서, 다음 단계는 단순히 서버를 늘리는 것을 넘어 자체 서버실 구축을 포함한 더 큰 구조의 선택을 검토하는 단계로 이어지고 있습니다.
서버실을 자체적으로 운영할 경우 상시 관리 인력과 운영 노하우가 필요한 만큼, 관리 부담을 어떻게 최소화하면서도 확장 속도를 따라갈 것인지가 다음 단계 결정에서 중요한 기준이 되고 있습니다. 양산 규모가 커지는 만큼, 학습·검증해야 할 데이터와 모델도 함께 늘어날 가능성이 있습니다.
앞으로도 매니코어소프트는 홀리데이로보틱스의 성장 단계마다 필요한 인프라를 함께 만들어갈 계획입니다.
결론: 반년 만에 연구 인력을 20명에서 70명으로 늘리는 동안, 매니코어소프트는 고성능 GPU 서버를 연속으로 공급하며 안정적인 AI 개발 환경을 뒷받침했습니다. 그리고 지금은 워크로드에 맞춰 서로 다른 GPU를 조합하는 하이브리드 클러스터로 함께 확장하고 있습니다. 매니코어소프트가 증명한 것은 GPU 10장을 촘촘히 담고도 안정적으로 돌아간다는 밀도의 문제만이 아니라, 빠르게 성장하는 스타트업이 인프라 걱정 없이 다음 단계로 나아갈 수 있도록 함께 확장해나가는 파트너십입니다.