[K-AX는 지금] “피지컬 AI의 토양은 결국 데이터”…양수열 크라우드웍스 CAIO가 보는 ‘2차 AI 혁명’

“특정 시나리오 AI, 학습데이터 없이 고도화 어렵다”…온톨로지로 데이터의 관계·맥락까지 설계
‘알피’로 비정형 문서 전처리부터 에이전트 개발·평가·운영까지…금융권서 ‘AI-ready 데이터’ 검증
VLA·월드모델 위한 영상·센서 데이터 통합…K-AX 통해 제조 특화 AI의 산업 적용 확대

[편집자 주] 인공지능(AI)이 국가와 기업의 경쟁력을 좌우하는 핵심 인프라로 자리 잡는 상황에서 정부의 지원 하에 민간 중심 협력체로 출범한 K-AI PARTNERSHIP의 활동이 기대를 모으고 있다. 지난 4월 본격적인 활동을 시작한 K-AI PARTNERSHIP은 AI 기업과 제조·금융 등 수요기업, 관련 기관이 참여해 AI 생태계 강화와 산업 AI 전환(AX), 글로벌 진출을 추진하고 있다. 이에 테크42는 ‘K-AX는 지금’ 시리즈를 통해 참여 기업들의 목소리를 듣고 AX 전략과 미래 비전을 조명한다.


양수열 크라우드웍스 최고인공지능책임자(Chief AI Officer, CAIO). 양 CAIO는 과거 한국인 최초 자바(Java) 챔피언 이름을 알린 바 있다. 이후 C언어와 윈도 프로그래밍에서 시작해 웹·모바일·빅데이터·사물인터넷(IoT), 머신러닝과 AI까지 국내 정보기술(IT)의 주요 전환기를 개발자로 경험해 왔다. (사진=크라우드웍스)

생성형 인공지능(AI)의 성능이 빠르게 높아지면서 한동안 데이터의 중요성이 이전보다 줄어들 것이라는 전망도 나왔다. 충분히 큰 모델이 만들어지고 사전학습 능력이 좋아지면 기업이나 산업별로 데이터를 다시 수집하고 가공하는 수고 역시 줄어들 것이라는 기대였다.

하지만 AI가 화면 속 문답을 넘어 공장과 로봇 등 현실 세계로 나오기 시작하면서 문제는 오히려 복잡해지고 있다. 로봇이 부품을 집어 옮기는 동작 하나를 학습하려 해도 카메라 영상과 여러 센서 데이터의 시점을 맞춰야 하고, 시간이 지나면서 생기는 센서 오차도 보정해야 한다. 어떤 상황에서 어떤 행동이 일어났는지 의미를 연결하고, 만들어진 데이터가 실제 학습에 적합한지도 다시 검증해야 한다.

2017년 설립된 크라우드웍스는 이런 변화의 한복판에 있다. AI 학습데이터 수집·가공 사업에서 출발해 현재는 기업용 에이전틱 AI(Agentic AI) 솔루션과 데이터 엔지니어링, 피지컬 AI(Physical AI)까지 사업 범위를 넓혔다. 최근 기준 크라우드웍스는 1200건 이상의 AI 프로젝트와 3억건 이상의 구축 데이터, 620곳 이상의 고객이 주요 레퍼런스로 제시돼 있다.

특히 올해는 모티프테크놀로지스 컨소시엄의 독자 AI 파운데이션 모델 프로젝트 정예팀에서 데이터 구축을 담당했으며, 현재 LG전자 컨소시엄의 ‘피지컬 AI 모델 학습을 위한 월드 파운데이션 모델 기술개발’ 사업에도 참여하고 있다.

크라우드웍스는 AI 학습데이터 수집·가공 사업에서 출발해 현재는 기업용 에이전틱 AI(Agentic AI) 솔루션과 데이터 엔지니어링, 피지컬 AI(Physical AI)까지 사업 범위를 넓혔다. 사진은 지난 5월 코엑스에서 열린 2026 AI EXPO 크라우드웍스 부스에서 로봇을 이용한 피지컬AI 데이터 수집 시연 모습. (사진=크라우드웍스)

이러한 격변의 시기에 크라우드웍스의 기술 방향을 이끄는 인물 중 한 명이 양수열 최고인공지능책임자(Chief AI Officer, CAIO)다. 과거 한국인 최초 자바(Java) 챔피언으로 알려지기도 한 양 CAIO는 C언어와 윈도 프로그래밍에서 시작해 웹·모바일·빅데이터·사물인터넷(IoT), 머신러닝과 AI까지 국내 정보기술(IT)의 주요 전환기를 개발자로 경험해 왔다. 현재 크라우드웍스에서는 피지컬 AI 현장 적용과 초거대 언어모델(Large Language Model, LLM) 개발을 담당하고 있다.

LLM에서 에이전트, 다시 피지컬 AI로 빠르게 기술의 무게추가 이동하는 지금 데이터는 어떤 모습으로 달라져야 할까. 양 CAIO는 크라우드웍스가 해온 일을 ‘라벨링’보다 더 넓은 데이터 엔지니어링의 관점에서 보고 있다며 말문을 열었다.

모델이 커져도 ‘좋은 데이터’는 사라지지 않는다…라벨링에서 데이터 엔지니어링으로

크라우드웍스의 데이터 가공 올인원 솔루션 ‘Workstage’. 이미지·비디오·오디오·텍스트·포인트클라우드 등 다양한 형태의 데이터 가공과 프로젝트 관리를 지원한다. (자료=크라우드웍스)

크라우드웍스의 초기 사업은 사람이 이미지·영상·텍스트 등에 정답 정보를 붙여 AI가 학습할 수 있는 데이터로 만드는 데 초점이 맞춰져 있었다. 이후 자율주행용 라이다(LiDAR)·포인트클라우드, 음성·의료·금융·전문지식 데이터로 범위가 넓어졌고, 생성형 AI 시대에는 LLM 학습과 검색증강생성(Retrieval-Augmented Generation, RAG), AI 에이전트를 위한 데이터 구축으로 역할이 확대됐다. 현재는 피지컬 AI에서 영상과 센서, 시뮬레이션, 로봇 행동 데이터 등을 함께 다루는 작업을 진행 중이다.

크라우드웍스는 현재 데이터 사업을 단순 수집·가공이 아니라 수집부터 가공·평가까지 연결되는 ‘데이터 파이프라인 구축’으로 정의하고 있다. 기술 세대가 달라지면서 ‘고품질 데이터’의 의미도 달라지고 있다.

대규모 언어모델 초기에는 방대한 텍스트를 확보하는 것 자체가 중요한 과제였다면 추론모델이나 산업 특화 AI는 어떤 문제를 풀게 할 것인지에 맞춰 데이터 구성을 설계하는 작업이 중요해졌다. 특히 피지컬 AI는 웹에서 쉽게 확보할 수 있는 텍스트와 달리 실제 환경에서 촬영·수집해야 하는 데이터가 많아 부족 현상도 상대적으로 크다. 양 CAIO는 이 지점을 범용 모델과 산업 현장용 모델의 차이로 설명했다.

“범용적인 용도의 피지컬 AI 모델은 있을 수 있다고 생각합니다. 하지만 특정 시나리오에서 고도로 작동해야 하는 AI 모델이 학습데이터 없이 성장하는 것은 사실상 불가능하다고 봅니다. GPT-3.0 때 필요했던 학습데이터셋과 지금 빅테크가 요구하는 학습데이터셋은 구성이 다르다고 생각합니다. 추론을 위해서는 더 다양한 정보로 구성되고, 추론에 맞게 정제·최적화된 데이터가 필요합니다. 특히 피지컬 AI는 아직 데이터가 많지 않고 상당수가 영상이라 정교하게 잘 만들어진 학습데이터의 수요가 여전히 크다고 봅니다.”

데이터의 품질을 높이는 방법으로 크라우드웍스가 강조하는 기술 가운데 하나가 온톨로지(Ontology)다. 기존 데이터 라벨링이 개별 이미지나 문장에 정답을 표시하는 과정이었다면 온톨로지는 데이터가 서로 어떤 의미와 관계를 갖는지까지 구조화한다. 단순히 정보를 저장하는 것을 넘어 ‘A 데이터가 B 공정과 어떤 관계가 있고, 특정 상태가 어떤 결과와 이어지는가’를 AI가 활용할 수 있도록 만드는 방식이다.

이는 추론 과정에서도 중요하다. AI가 각각 떨어져 있는 데이터를 검색하는 것을 넘어 서로 다른 데이터 간 관계와 맥락까지 따라가야 산업 현장의 복잡한 질문에 대응할 수 있기 때문이다. 양 CAIO는 크라우드웍스의 기존 역량에 그래프 기술과 온톨로지를 결합하는 작업을 추진하고 있는 과정을 설명했다.

“저희는 데이터 기업이다 보니 문서를 파싱해 구조화하고, 구조화된 데이터에 의미를 부여할 수 있는 기반을 갖고 있습니다. 여기에 온톨로지나 그래프 기술이 더해지면 고품질 데이터를 만드는 데 도움이 될 수 있습니다. 기존 시스템의 데이터 사이 연관관계를 구축하는 것도 결국 온톨로지의 역할이라고 생각합니다. 사람의 질문(자연어)을 데이터베이스 명령어로 바꾸는 NL2SQL에서도 질문의 의미와 실제 데이터 간 관계를 정확히 연결해 주는 중간 구조가 필요한데, 저는 그 역할을 온톨로지 레이어라고 봅니다. 이런 기술을 제품에 반영하기 위한 개발도 계속 진행하고 있습니다.”

즉 크라우드웍스가 말하는 데이터 엔지니어링은 결국 ‘얼마나 많은 데이터를 갖고 있느냐’에서 ‘특정 AI가 제대로 학습하고 추론할 수 있도록 데이터를 어떻게 설계하느냐’로 무게중심을 옮기는 과정이다.

AI가 문서를 못 읽으면 에이전트도 소용없다…‘알피’가 데이터부터 보는 이유

문서 복잡도를 정량적으로 분석할 수 있는 데이터 파서 Alpy Knowledge Compiler 솔루션 화면. (자료=크라우드웍스)

이러한 접근은 크라우드웍스의 기업용 AI 사업에도 그대로 이어진다. 통합 솔루션 알피(Alpy)는 기업이 생성형 AI와 에이전트를 도입할 때 필요한 데이터 전처리부터 RAG, 에이전트 구축, 성능·안전성 평가와 운영관리까지 단계별로 지원하는 구조다. 그 출발점은 ‘AI가 기업 문서를 제대로 읽을 수 있느냐’다.

기업이 보유한 PDF나 한글(HWP), 프레젠테이션, 표·도표가 포함된 보고서는 사람이 읽을 때는 문제가 없어도 기계가 문서의 구조와 맥락을 그대로 이해하기는 쉽지 않다. 양 CAIO는 “국내 기업 문서를 처리하는 과정에서 표 안에 다시 표가 들어가거나 제목이 하나의 표 셀로 구성되는 등 자동 파싱 과정에서 구조가 훼손되기 쉬운 사례도 접했다”고 설명했다.

알피 날리지 컴파일러(Alpy Knowledge Compiler)는 이런 비정형 문서를 파싱(Parsing), 광학문자인식(Optical Character Recognition, OCR), 청킹(Chunking) 등을 거쳐 RAG가 활용할 수 있는 형태로 바꾼다. ‘KC Confidence’로 파싱 신뢰도를 점검하고 ‘Document Complexity’로 문서 복잡도를 정량화해 자동처리 범위와 사람이 직접 확인해야 할 범위를 사전에 가늠하는 기능도 제공한다. PDF와 DOCX뿐 아니라 HWP와 PPT도 JSON이나 마크다운 등 AI가 활용할 수 있는 데이터 형태로 변환할 수 있다. 양 CAIO는 기업이 실제 AI 구축에 필요한 시간과 비용을 예측할 수 있도록 만드는 것의 중요성을 강조하며 말을 이어갔다.

“문서를 100% 자동으로 처리해 주는 솔루션은 없습니다. 고객을 만나면 ‘우리 문서가 150만건인데 그중 기계로 안 되는 게 얼마나 되고, 예산을 어느 정도 잡아야 하느냐’는 질문을 받습니다. 저희는 문서 복잡도를 정량적인 수치로 만들고 문서 처리 신뢰도를 수치화해서 보여주는 기술을 갖고 있습니다. 여러 기업을 만나보면 문서 복잡도를 이런 식으로 수치로 제시하는 경우는 많지 않았습니다. 저희는 자체 기술을 통해 이를 제공할 수 있다는 점을 중요한 차별점으로 보고 있습니다.”

특히 기업용 RAG에서는 이 앞단의 데이터 품질이 곧 결과의 품질로 이어진다. 원문 구조가 파싱 과정에서 깨지면 이후 임베딩과 벡터 데이터베이스에 잘못된 정보가 들어가고, 검색 알고리즘이나 LLM 성능이 좋아도 원하는 답변을 얻기 어렵다.

양 CAIO가 “파싱 단계에서 벡터DB에 제대로 적재되지 않으면 RAG를 아무리 잘 만들어도 결과가 나오지 않는다”고 강조한 것 역시 그 때문이다. 초기부터 AI 학습데이터를 가공해 온 경험이 현재의 생성형 AI 솔루션으로 이어지는 대목이기도 하다.

날리지 컴파일러 다음 단계에는 노코드 방식의 알피 에이전트 스튜디오(Alpy Agent Studio)가 있다. 개발자가 아닌 현업 담당자도 도구 호출(Tool Calling), 가드레일(Guardrail), 에이전트, 스트리밍 등의 노드를 조합해 업무 에이전트를 만들 수 있다. 개인정보·민감정보 차단과 사용자 권한 관리, 응답 품질·운영비용·장애상태를 확인하는 통합 모니터링도 포함된다. 성능과 안전성 검증은 알피 이밸류에이션(Alpy Evaluation)이 담당한다. LLM뿐 아니라 RAG와 에이전트의 성능·안전성, 도메인별 평가데이터셋까지 다루는 구조다.

다만 양 CAIO는 현재의 에이전틱 AI를 모든 업무를 스스로 결정하는 완전 자율 시스템으로 보는 데에는 선을 그었다. 일례로 크라우드웍스가 한국과학기술한림원과 구축한 재난안전 AI 에이전트 역시 복잡한 재난·안전 문제에 대한 연구 과정을 지원하는 방향으로 적용됐다. 현재 기술 수준에서는 업무 단계별 에이전트와 사람의 판단을 적절히 결합하는 접근이 현실적이라는 입장이다.

“AI가 엔드투엔드로 모든 의사결정을 하고 이상적인 멀티 에이전트 플랫폼처럼 작동할 수 있느냐에 대해서는 아직 회의적입니다. 우선은 각 프로세스에 에이전트를 구축하고, 결정론적 영역과 비결정론적 영역 사이에 사람이 개입하는 형태가 지금으로서는 합리적이라고 봅니다. 현재도 우선 그런 형태로 구축되고 있습니다. 다만 좀 더 나중에는 어느 정도 엔드투엔드까지 이어지는 영역도 생길 것이라고 생각합니다.”

5분 영상이 30GB…피지컬 AI가 다시 ‘데이터 문제’인 이유

크라우드웍스 피지컬 AI 데이터 플랫폼 이해도. (자료=크라우드웍스)

크라우드웍스가 올해 가장 적극적으로 넓히는 영역은 피지컬 AI다. 올해 피지컬 AI 데이터 플랫폼을 선보이고 관련 데이터랩을 신설했다.

크라우드웍스에 따르면 피지컬 AI 데이터 플랫폼은 비전-언어-행동(Vision-Language-Action, VLA) 모델에 필요한 데이터의 수집·학습·검증·운영을 통합 관리하는 시스템이다. 확장현실(XR)과 원격조작(Teleoperation)을 이용한 데이터 수집·가공부터 1인칭(Egocentric) 방식 등으로 지원 범위를 넓히고 있다.

여기서 플랫폼이 필요한 이유는 기존 이미지 라벨링보다 데이터 자체가 훨씬 복잡하기 때문이다. 실제 로봇 학습에서는 여러 카메라가 찍은 영상과 각종 센서, 로봇의 위치·관절·행동 데이터가 함께 발생한다. 이를 특정 작업 하나에 대응하는 학습데이터로 만들려면 서로 다른 형태의 데이터를 하나의 시나리오로 묶어야 한다. 양 CAIO는 “데이터 플랫폼에 있어 단기적으로 가장 집중하는 부분은 피지컬 AI에 필요한 데이터를 관리하는 방식”이라며 말을 이어갔다.

“이 분야는 굉장히 뜨겁지만 역사가 짧아 여러 시도와 아이디어가 동시에 나오고 있습니다. 그래서 저희 플랫폼 위에 하나씩 레이어를 쌓아가는 것도 해볼 만한 도전이라고 봅니다. 아직 데이터를 만들고 생성하고 검증하는 많은 과정이 사람 손으로 이뤄지고 있습니다. 큰 기업에서도 엑셀에 사람이 직접 입력하는 경우가 있는데 이런 작업을 플랫폼으로 옮기면 많이 개선될 수 있다고 생각합니다.”

데이터의 크기부터 기존 AI와 차원이 다르다. 양 CAIO는 실제 프로젝트에서 5분가량 촬영한 데이터가 약 30GB에 달했던 사례를 소개했다. 영상과 센서 데이터가 함께 쌓이면서 저장공간뿐 아니라 데이터 전송과 센터 간 이동, 학습용 데이터셋 관리까지 새로운 문제가 발생한다는 설명이다. 크라우드웍스가 피지컬 AI 데이터 플랫폼을 단순 가공도구가 아니라 일종의 ‘데이터 팩토리’를 운영하는 관리계층으로 보려는 이유다.

원천 영상과 센서 데이터를 실제 학습데이터로 만드는 과정 역시 단순하지 않다. 양 CAIO는 서로 다른 데이터의 시간축과 오차를 맞추고, 완성된 데이터셋을 다시 검증하는 작업 자체가 피지컬 AI 시대의 데이터 엔지니어링이라고 설명했다.

양 CAIO는 서로 다른 데이터의 시간축과 오차를 맞추고, 완성된 데이터셋을 다시 검증하는 작업 자체가 피지컬 AI 시대의 데이터 엔지니어링이라고 설명했다. (사진=크라우드웍스)

“로봇이 컵 하나를 집어 옮기는 시나리오만 해도 학습데이터를 만드는 과정이 단순하지 않습니다. 센서는 시간이 지나면서 드리프트가 생겨 오차가 벌어지고, 그러면 서로 다른 데이터의 얼라인먼트가 맞지 않게 됩니다. 센서와 영상처럼 이종 데이터는 수집 주기도 서로 달라 이를 어떻게 동기화하고 보정할지가 데이터 엔지니어링의 영역입니다. 그렇게 만든 데이터셋이 맞는지 다시 검증해야 하는데 영상 1만개를 사람이 일일이 보는 것은 현실적이지 않습니다. 대신 AI가 할 부분과 사람이 확인할 부분을 플랫폼에서 나누면 모델을 만드는 데 필요한 시간을 크게 줄일 수 있습니다.”

크라우드웍스가 피지컬 AI에서 모델 자체보다 학습 전 단계에 무게를 두는 이유도 여기에 있다. 촬영된 원천 데이터를 VLA나 월드모델이 실제 학습할 수 있는 데이터셋으로 바꾸고 이를 검증·관리하는 구간을 담당한 뒤, 모델 개발기업과 연구기관이 사용할 수 있도록 하겠다는 전략이다.

범용 모델보다 ‘한국이 잘하는 산업’…조선·제조 특화 AI와 K-AX

크라우드웍스 피지컬AI 데이터 플랫폼의 VLA데이터 검수화면. (자료=크라우드웍스)

피지컬 AI 데이터 사업은 자연스럽게 한국 제조업의 AI 전환과 연결된다. 양 CAIO는 범용 파운데이션 모델 경쟁에서 해외 빅테크가 앞서 있다는 점과 별개로, 한국이 강점을 가진 제조·산업 영역에서는 특화 AI의 경쟁력을 확보할 여지가 크다고 봤다.

크라우드웍스는 산업 특화 AI 가운데 조선 분야에도 공을 들이고 있다. 이미 조선소 비전 AI를 위해 용융풀·용접봉·심라인 이미지 1만5000건 이상을 가공한 사례와 선박 자율주행 데이터 구축 사례가 확보돼 있다. 올해는 조선업 특화 초거대 산업 AI 연구지원사업에도 참여하고 있다.

크라우드웍스가 현장에서 확인한 병목은 범용모델의 벤치마크 성능과 실제 산업지식 사이의 간극이다. 특히 조선업에서는 장기간 축적된 현장 경험과 지식을 AI가 학습 가능한 데이터로 바꾸는 문제가 남는다.

“조선업은 문서 데이터도 많지만 데이터화하거나 문서화하기 어려운 암묵지 영역이 많은 산업입니다. 과제를 하면서 조선업을 이해해보니 현장에서 10년, 20년 일한 분들은 사용하는 말과 표현, 용어부터 다릅니다. 재미있는 건 학문으로서 조선업에서 쓰는 용어와 실제 현장에서 쓰는 용어도 다르다는 점입니다. 그런 환경에서는 범용 모델의 성능이 아무리 좋아도 그대로 현장에 적용하기가 쉽지 않습니다. 결국 특화된 용어와 다양한 비정형 데이터를 학습한 산업 특화 LLM이 필요합니다.”

이 문제는 K-AI PARTNERSHIP의 AX 확산 분과(K-AX)에 크라우드웍스가 기대하는 역할과도 연결된다. 제조 데이터는 기업의 생산공정과 노하우를 포함해 외부에서 접근하기 어렵다. AI 공급기업이 좋은 기술을 보유해도 실제 산업 데이터를 확보하지 못하면 현장에서 사용할 수 있는 특화 모델을 만들기 어렵고, 반대로 수요기업은 데이터를 보유하고 있어도 이를 학습 가능한 구조로 만드는 기술과 인력이 부족할 수 있다.

선박 자율주행 솔루션용 데이터 구축 사례. 크라우드웍스는 1만5000건 이상의 Object Direction·Polygon 데이터 라벨링을 수행했다. (자료=크라우드웍스)

양 CAIO는 공급기업과 수요기업이 함께 참여하는 K-AX와 같은 협력구조를 통해 제조 데이터에 접근하고 이를 산업 특화 모델로 연결할 가능성을 높게 봤다. 연구과제로 끝나는 AI가 아니라 실제 산업현장에서 사용되고, 검증된 기술이 같은 산업의 다른 기업으로 확산되는 구조가 필요하다는 것이다.

“특히 제조처럼 데이터에 접근하기 어려운 분야에서는 이런 협업을 통해 특화된 모델을 만들고, 그 모델에서 사용할 데이터를 만드는 것이 굉장히 큰 기회라고 생각합니다. 연구과제로 남는 AI가 아니라 실제 산업에서 쓰이고, 만들어진 모델을 같은 산업의 다른 기업도 사용할 수 있는 구조가 가능할 것이라고 봅니다.”

이처럼 피지컬 AI 월드모델, 제조·조선 특화 LLM, 독자 파운데이션 모델은 형태는 서로 다르지만 필요한 데이터를 정의하고 학습 가능한 상태로 만드는 과정에서는 공통점을 갖는다. 양 CAIO가 인터뷰 말미, 다시 데이터를 언급한 이유다.

양 CAIO는 LLM을 ‘1차 AI 혁명’, 피지컬 AI를 ‘2차 AI 혁명’으로 표현했다. 전자가 언어와 지식의 세계에서 인간과 AI의 관계를 바꿨다면 후자는 제조·물류·로봇처럼 실제 산업현장에서 AI가 물리적 행동으로 가치를 만들어내는 단계라는 의미다. (사진=크라우드웍스)

“피지컬 AI라고 해서 모두 피지컬 이야기만 하지만, 한정된 GPU나 컴퓨팅 자원으로 고효율 모델을 만드는 데 첫 번째 전제조건은 데이터 품질이라고 생각합니다. 저희는 데이터 품질에 대해 가장 오래 고민해 온 회사 중 하나라고 생각합니다. 밑거름이 되는 토지가 좋지 않은데 좋은 수확을 할 수는 없습니다. 토지를 먼저 잘 개간해야 하듯 피지컬 AI에서도 그 토양 역할을 하는 것이 데이터라는 점을 강조하고 싶습니다.”

그러면서 양 CAIO는 LLM을 ‘1차 AI 혁명’, 피지컬 AI를 ‘2차 AI 혁명’으로 표현했다. 전자가 언어와 지식의 세계에서 인간과 AI의 관계를 바꿨다면 후자는 제조·물류·로봇처럼 실제 산업현장에서 AI가 물리적 행동으로 가치를 만들어내는 단계라는 의미다.

크라우드웍스가 그 변화 속에서 확보하려는 위치는 모든 모델을 직접 만드는 기업이라기보다, 좋은 모델이 나올 수 있도록 산업 데이터를 수집하고 구조화하고 연결·검증하는 기반을 제공하는 데이터 플랫폼 기업이라 할 수 있다. LLM에서 피지컬 AI로 무대가 달라져도 출발점은 결국 같다. 모델이 무엇을 할 수 있는지를 따지기 전에, 그 모델이 무엇을 보고 배울 것인지부터 제대로 만들어야 한다는 것이다.

황정호 기자

jhh@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

"1000대 팔 수 있다"… 사천 공장이 24시간 돌아가는 이유

한국항공우주산업(KAI)은 국내 유일의 완제기 제조기업으로, 전투기와 훈련기, 헬기 등 군용 항공기부터 항공기 구조물과 위성·우주사업까지 아우르는 종합 항공우주 기업이다.

"수리비 90만원, 새 노트북 300만원"…반도체 대란에 소비자만 울상

딸 아이의 중학교 입학 선물로 사줬던 노트북. 몇 달 전 갑자기 안 켜져서 서비스센터에 들고 갔다. 메인보드가 나갔다는 진단을 받았는데, 수리 견적을 듣고는 말문이 막혔다. 92만원. 구입 시 130만원 주고 산 걸 생각하면 거의 70%나 되는 돈이었다.

[현장] 기술만으론 부족하다…딥테크 투자부터 상장까지 ‘시장 검증’이 가른다

딥테크(Deep Tech)가 국내 벤처투자 시장의 중심으로 이동하고 있다. 2025년 인공지능(AI), 반도체, 로보틱스, 헬스케어 등 12대 신산업 분야에 투입된 벤처투자금은 5조2014억원으로 전체 벤처투자 6조8111억원의 76.4%를 차지했다. 특히 올해 들어서는 AI와 로보틱스를 향한 투자 집중도 두드러졌다.

샤오미폰에 중국산 메모리가 들어간 날, 삼성·SK 긴장한 이유

지난 8월 말, 샤오미가 자사 폴더블폰 신제품에 중국산 메모리 반도체를 탑재한다는 소식이 전해졌다. 공급사는 창신메모리테크놀로지(CXMT). 2016년 설립된 이 회사가 만든 LPDDR6 메모리가 샤오미의 차세대 스마트폰에 들어간다는 발표였다.