[딜사이트 최령 기자] 네이버가 차세대 AI 검색을 구현하기 위한 핵심 기술 3종을 공개했다. AI 검색 전용으로 최적화한 대규모언어모델(LLM), AI 운영 기술인 '하네스 엔지니어링(Harness Engineering)', 스마트렌즈 기반의 멀티모달 기술을 앞세워 검색을 넘어 구매·예약 등 실행까지 연결하는 AI 에이전트 서비스를 고도화한다는 전략이다.
네이버는 2일 네이버 D2SF 강남에서 '탐색에서 실행까지, 차세대 AI 기술이 만드는 네이버 AI 검색'을 주제로 테크 딥톡 세션을 열고 ▲AI탭 최적화 모델 ▲하네스 엔지니어링 ▲멀티모달 기술 등 차세대 AI 검색을 구현하는 핵심 기술을 소개했다.
먼저 네이버는 AI탭에 적용한 새로운 경량 AI 모델을 공개했다. 기존 하이퍼클로바X(HCX)를 기반으로 개발한 이 모델은 네이버의 데이터와 서비스 시나리오, 사용자 피드백을 모델 설계 전반에 반영한 '프로덕트 네이티브 LLM'이다.
모델은 데이터와 아키텍처, 트레이닝을 중심으로 서비스 환경에 맞게 최적화됐다. 문서 품질 필터와 서비스형 데이터 수집 파이프라인을 구축해 검색·쇼핑·플레이스·생활정보 등 서비스 데이터를 사전 학습 단계부터 반영했으며, 대규모 서비스 환경에 적합한 MoE(Mixture of Experts) 구조를 도입해 응답 속도와 처리량을 개선했다.
특히 입력 길이가 길어질수록 연산량이 크게 증가하는 기존 트랜스포머 구조와 달리 연산량을 입력 길이에 선형적으로 비례하도록 개선해 긴 문맥에서도 안정적인 응답 속도를 유지하도록 설계했다. 이에 따라 긴 대화와 복합 작업을 수행하는 AI 에이전트 환경에서 경쟁력을 확보했다는 설명이다.
강화학습도 대폭 확대했다. 강화학습에 투입하는 컴퓨팅 자원을 기존 HCX 대비 두 배 이상 늘렸으며 검색과 예약 등 실제 네이버 서비스를 연계한 학습 환경을 구축해 다양한 도구를 활용해 사용자의 과업을 수행하도록 학습시켰다.
또 사용자의 질문이 모호할 경우 추가 질문을 통해 의도를 확인하도록 학습하는 'Clarify RL(명료성 강화학습)'을 새롭게 적용했다. 네이버는 글로벌 AI 성능 평가기관인 아티피셜 애널리시스(Artificial Analysis)의 AA-옴니사이언스(Omniscience) 벤치마크 기준으로 기존 HCX 대비 환각(할루시네이션) 비율이 최대 30%포인트 감소했다고 밝혔다.
이와 함께 학습 중인 모델이 생성한 답변을 고성능 모델이 토큰 단위로 첨삭하는 OPD(On-Policy Distillation) 기법도 적용했다. 전문성이 부족한 영역의 성능을 보완하는 동시에 상위 모델이 개선될수록 하위 모델도 함께 성능이 향상되는 구조다.
네이버는 자체 벤치마크 결과 AI탭 모델이 검색·구매·예약 등 서비스 수행 역량에서 글로벌 동급 모델 평균(100점)을 웃도는 108점을 기록했으며, 지시 이행과 도구 호출 등 기본 역량에서도 평균 대비 높은 104점을 기록했다고 설명했다.
AI 에이전트 운영 기술인 '하네스 엔지니어링'도 공개했다. 하네스 엔지니어링은 AI가 부적절한 답변을 하지 않도록 제어하는 동시에 필요한 정보를 탐색하고 적절한 도구를 활용해 사용자의 요청을 끝까지 수행하도록 설계된 기술이다. 안전 필터를 비롯해 사용자 의도 이해와 긴 대화 맥락 관리, 검색·쇼핑·플레이스 연계 추론, 출처 제공 및 실행 연결 등 네 단계로 동작한다.
네이버는 AI탭 운영 효율을 높이기 위해 역할별 소형 언어모델(SLM)을 조합한 분업형 구조도 도입했다. 하나의 대형 LLM이 모든 작업을 수행하는 대신 역할별 특화 모델을 활용해 일부 컴포넌트의 운영 비용은 최대 3배 절감하고 응답 속도는 두 배 이상 개선했다. 새로운 소형 모델이 개발될 경우 해당 기능만 플러그인 형태로 교체할 수 있어 서비스 중단 없이 성능을 지속적으로 개선할 수 있다는 점도 장점으로 꼽았다.
네이버는 스마트렌즈를 중심으로 한 멀티모달 검색 기술 고도화 전략도 제시했다. 멀티모달은 이미지를 AI가 이해할 수 있는 형태로 변환해 텍스트와 이미지, 영상 등 다양한 정보를 함께 이해하고 활용하는 기술이다.
네이버는 2017년 스마트렌즈 출시 이후 축적한 시각 검색 기술을 기반으로 상품 검색을 넘어 다양한 분야에서 실행형 멀티모달 검색 경험을 제공할 계획이다. 사용자가 이미지를 한 번만 입력해도 탐색과 질의, 예약 등으로 이어지는 연속적인 AI 검색 경험을 구현하는 것이 목표다.
이를 위해 네이버는 3500만 건 규모의 멀티모달 데이터셋을 구축했으며 'CVPR'에서 소개한 'MuCo(Multi-turn Contrastive Learning)' 기술을 통해 이미지와 대화 문맥을 함께 이해하는 멀티모달 임베딩 기술도 고도화하고 있다. 회사는 주요 멀티모달 검색 벤치마크인 MMEB와 M-BEIR에서도 경쟁 모델 대비 최고 수준의 성능을 기록했다고 밝혔다.
전체 내용과 맥락을 이해하기 위해서는 기사 본문과 함께 읽어주세요
ⓒ새로운 눈으로 시장을 바라봅니다. 딜사이트 무단전재 배포금지
Home
