카카오브레인, 이미지 생성 모델 ‘RQ-Transformer’ 깃허브에 공개

‘사막에 있는 에펠탑(the Eiffel Tower in the desert)’이라는 텍스트 조건에 의해 생성된 샘플 이미지. (이미지=카카오브레인)

카카오브레인이 지난해 12월에 공개한 초거대 멀티모달(multimodal) AI ‘minDALL-E(민달리)의 업그레이드 버전인 이미지 생성 모델 ‘RQ-Transformer’를 최대 오픈소스 커뮤니티 깃허브(GitHub) 에 공개했다고 19일 밝혔다.

39억 개의 매개변수(파라미터)로 구성된 ‘RQ-Transformer’는 3000만 쌍의 텍스트-이미지를 학습한 text-to-image AI 모델로, 계산 비용을 줄이고 이미지 생성 속도를 높인 동시에 이미지의 품질을 크게 향상시킨 것이 특징이다. 카카오브레인이 공개한 RQ-Transformer는 공개된 이미지 생성 모델 중 국내 최대 크기의 이미지 생성 모델이며, 이를 공공 목적을 위해 공개했다는 점에서 AI 커뮤니티에 기여가 클 것으로 기대를 모으고 있다.

‘RQ-Transformer’는 카카오브레인의 초거대 멀티모달(multimodal) AI ‘minDALL-E(민달리)’의 업그레이드 버전으로, ‘minDALL-E’ 대비 모델 크기는 3배, 이미지 생성 속도와 학습 데이터셋 크기는 2배 늘렸다. 특히 ‘minDALL-E’의 경우 미국의 인공지능 개발 기업 ‘오픈AI(OpenAI)’가 공개한 ‘DALL-E’를 재현하는 것에 가까웠던 것에 반해, ‘RQ-Transformer’의 경우는 카카오브레인 만의 독자적인 기술로 개발됐다.

또 고해상도의 이미지를 2차원의 코드맵으로 표현하는 기존 기술과 달리 ‘RQ-Transformer’는 3차원의 코드맵으로 표현된 이미지를 순차적으로 예측해 생성하도록 학습된 이미지 생성 모델이다. 기존 기술과 비교했을 때 이미지 압축으로 인한 손실이 적어, 높은 품질의 이미지를 저해상도의 코드맵으로 표현하는 것 또한 특징 중 하나다. 이를 통해 ‘RQ-Transformer’는 기존 이미지 생성 모델보다 적은 계산 비용과 높은 이미지 생성 속도를 달성할 수 있다.

대규모 데이터셋을 바탕으로 학습된 ‘RQ-Transformer’는 처음보는 텍스트의 조합을 이해하고, 이에 대응되는 이미지를 생성할 수 있다.

황정호 기자

jhh@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

美 행정부, 클래리티법 대신 SEC·CFTC 앞세워 가상자산 규제 정비 나선다

미 상원의 클래리티법 절차표결 무산 이후 백악관과 재무부가 SEC·CFTC의 현행 권한을 활용한 가상자산 제도 정비를 공식화했다. SEC 토큰화 주식 '혁신 면제'와 비트코인 반등 흐름을 함께 짚었다.

타다, 반복 이동 한 번에 묶는다…최대 4주 ‘정기 예약’ 출시

출퇴근·등하원·병원 방문 등 반복 일정 한 번에 등록 요일·시간·경로 설정하면 최대 28건 예약 생성…날짜별 조정 가능 선호 드라이버·카시트 차량 지원…변경·취소도...

[현장] 기술만으론 부족하다…딥테크 투자부터 상장까지 ‘시장 검증’이 가른다

딥테크(Deep Tech)가 국내 벤처투자 시장의 중심으로 이동하고 있다. 2025년 인공지능(AI), 반도체, 로보틱스, 헬스케어 등 12대 신산업 분야에 투입된 벤처투자금은 5조2014억원으로 전체 벤처투자 6조8111억원의 76.4%를 차지했다. 특히 올해 들어서는 AI와 로보틱스를 향한 투자 집중도 두드러졌다.

지갑·휴대폰 없이 영화표 산다…토스 ‘페이스페이’, CGV로 사용처 확대

토스와 CJ CGV는 21일 영화관에 페이스페이를 적용하기 위한 업무협약(MOU)을 체결했다. 양사는 CGV 용산아이파크몰점을 시작으로 서비스를 순차적으로 적용하고 향후 전국 극장으로 확대하는 것을 목표로 하고 있다.