AI 모델

NVIDIA, 멀티모델 에이전트용 Nemotron 3.5 Lightning과 NeMo Switchyard 출시

NVIDIA가 특화된 에이전트 작업을 위한 효율적인 오픈 모델과 모델 품질·속도·비용의 균형을 맞추도록 설계된 오픈 라우팅 라이브러리를 공개했다.

게시일 업데이트
NVIDIANemotron 3.5 LightningNeMo Switchyard

NVIDIA가 오픈 모델 라인업에 Nemotron 3.5 Lightning을 추가하고, 에이전트 시스템이 모든 요청을 같은 모델에 보내는 대신 여러 모델 중 하나를 선택하도록 돕는 라우팅 라이브러리 NeMo Switchyard를 공개했다. 8월 11일 발표는 대량의 특화 작업에 적합한 비교적 작은 모델과 정확도, 지연 시간, 비용 같은 요구 사항에 따라 에이전트 워크플로의 각 단계를 보낼 수 있는 소프트웨어를 결합한다. 두 제품은 업계가 개별 모델 간 경쟁에서 모델들이 서로 다른 역할을 맡는 시스템으로 이동하고 있음을 보여준다.

Nemotron 3.5 Lightning은 300억 개 매개변수를 가진 전문가 혼합 모델이다. 이 아키텍처에서는 특정 요청에 네트워크의 일부만 활성화되므로, 모델은 토큰마다 모든 매개변수를 사용하지 않고도 더 큰 전체 용량을 제공할 수 있다. NVIDIA는 Lightning을 업무의 모든 부분을 계획하고 해결해야 하는 모델이 아니라 더 큰 에이전트 시스템 안에서 실행을 담당하는 모델로 포지셔닝한다. 회사는 특화 작업으로 코드 검토, 도구 사용, 보안 경보 모니터링, 청구 관련 질문을 들었으며, 더 큰 프런티어 모델이 더 넓은 워크플로를 조정할 수 있다고 설명한다.

NVIDIA는 Lightning이 같은 등급의 다른 모델보다 최대 4배 빠르게 출력하고 에이전트형 작업을 30% 더 빨리 완료할 수 있다고 말한다. 이 수치는 NVIDIA와 발표에서 설명된 평가에서 나온 것이므로 구매자는 여전히 자체 워크로드로 모델을 시험해야 한다. 이번 릴리스는 Nemotron Coalition의 기여로 개발됐으며, NVIDIA는 코딩 에이전트 사후 학습에 사용된 에이전트형 강화학습 데이터세트도 공개한다. 조직은 NVIDIA NeMo를 사용해 자체 도메인 데이터, 도구, 작업 패턴에 맞게 모델을 조정할 수도 있다.

배포 유연성은 제안의 핵심이다. NVIDIA는 이 모델을 RTX PC, DGX Spark, DGX Station, Jetson 시스템에서 로컬로 실행할 수 있고, 워크스테이션, 데이터센터, 엣지 기기, 클라우드 서비스 전반에도 배포할 수 있다고 말한다. 요청량이 많거나 빠른 응답이 필요하거나 조직이 제3자 모델 엔드포인트에 보내고 싶지 않은 정보를 다루는 작업에서는 로컬 또는 온프레미스 운영이 중요할 수 있다. Lightning은 Hugging Face, ModelScope, OpenRouter와 NVIDIA NIM 마이크로서비스를 포함한 NVIDIA 서비스에서 이용할 수 있다.

NeMo Switchyard는 또 다른 비용 원인을 다룬다. 유능한 프런티어 모델은 어려운 추론 단계에 유용할 수 있지만 일상적인 분류나 조회에는 불필요하게 비쌀 수 있다. 이 오픈소스 라이브러리를 이용하면 개발자는 주변 애플리케이션을 다시 작성하지 않고도 프롬프트를 서로 다른 오픈 모델, 독점 모델 또는 NVIDIA 모델로 보내는 라우터를 만들 수 있다. 라우팅 로직은 품질, 응답 시간, 비용에 대해 팀이 선호하는 균형을 반영하도록 수정할 수 있다. NVIDIA는 내부 벤치마크에서 프런티어 수준 정확도를 유지하면서 작업 완료 비용을 Opus 4.8만 사용할 때의 거의 3분의 1로 줄였다고 말한다.

발표에 담긴 파트너 결과는 라우팅 주장의 가능성과 한계를 모두 보여준다. LangChain은 145개의 멀티턴 Deep Agents 작업에서 호출 중 7%만 프런티어 모델로 보냈을 때 비용이 74% 낮아졌지만 정확도는 6% 희생됐다고 보고했다. Ramp는 소프트웨어 엔지니어링 벤치마크에서 프런티어 모델 성능에 맞추면서 비용을 58%, 실행 시간을 33% 줄였다고 밝혔다. Cognition은 NVIDIA 내부 환경에서 Devin Desktop과 함께 사용한 단계형 라우터의 평균 비용이 28% 감소했다고 보고했다. 이는 공급업체와 파트너가 측정한 결과이지 보편적인 보장은 아니다.

이번 릴리스는 모델 선택을 에이전트 제품 안의 명시적인 엔지니어링 결정으로 만든다. 라우터는 낭비를 줄일 수 있지만 평가해야 할 구성 요소를 하나 더 추가하기도 한다. 잘못 선택된 경로는 비용을 절약하면서 답변 품질을 낮추거나 민감한 작업을 잘못된 환경으로 보낼 수 있다. Nemotron 3.5 Lightning과 Switchyard의 실질적인 시험대는 팀이 라우팅 결정을 측정하고, 품질 저하를 감지하며, 특정 모델이 필요한 작업에서 시스템 선택을 재정의할 수 있는지다. 이 운영 계층이 제대로 작동한다면 멀티모델 에이전트는 하나의 비싼 기본 모델에 덜 의존하고, 가장 잘 수행하는 작업에 특화된 서비스를 선택하는 다른 분산 소프트웨어 시스템과 더욱 닮아갈 수 있다.