AI 인프라

NVIDIA Groq 3 LPX 양산 돌입…AI 에이전트 추론은 GPU만으로 부족해진다

NVIDIA가 Groq 3 LPX의 본격 생산을 발표하며 Vera Rubin 시스템에 장문맥 및 에이전트형 AI용 고속 토큰 생성을 더했다.

게시일 업데이트
NVIDIAAI 추론에이전트 AI

NVIDIA가 Groq 3 LPX를 본격 생산에 들어갔다고 발표하며 Hot Chips 행사에서 AI 공장의 다음 병목은 추론이라고 강조했다. 회사는 8월 24일 이 대화형 추론 가속기가 Vera Rubin NVL72 플랫폼을 확장해 에이전트형 AI 시스템의 토큰 생성 속도를 크게 높인다고 밝혔다. AI 인프라의 다음 단계는 더 큰 모델을 얼마나 빨리 훈련하느냐만이 아니라, 배포된 모델이 긴 문맥을 읽고 여러 단계를 추론하며 사용자가 기다리지 않게 응답할 수 있느냐로 평가될 가능성이 크다.

Groq 3 LPX는 현대 추론에서 나타나는 구체적인 문제를 겨냥한다. AI 에이전트는 파일을 읽고, 도구를 호출하고, 결과를 확인하고, 코드를 쓰고, 계획을 수정하는 과정을 수백 번 반복할 수 있다. 이런 과정은 특히 긴 문맥 창을 유지할 때 엄청난 토큰을 만든다. GPU는 여전히 많은 작업에 강력하지만, NVIDIA는 응답성과 토큰당 비용이 상업적 병목이 되는 순간에는 생성 단계에 특화된 가속이 필요하다고 본다.

NVIDIA가 제시한 벤치마크에 따르면 Groq 3 LPX는 오픈소스 Gemma 4 31B 모델을 10만 토큰 문맥에서 실행하며 초당 약 3400개의 출력 토큰을 기록했다. 회사는 이를 해당 모델에서 기록된 가장 빠른 성능이라고 설명했고, 지연 시간에 민감한 작업에서는 가장 가까운 대체 플랫폼보다 약 네 배 빠른 응답성을 제공한다고 밝혔다. 공급업체 벤치마크는 현실 검증이 필요하지만, 추론이 훈련과 별개의 설계 문제가 되고 있다는 점은 분명하다.

이 제품은 NVIDIA가 Groq의 추론 기술을 라이선스하고 관련 인재를 확보한 뒤의 전략을 보여준다. Groq 3 LPX는 GPU를 대체하려는 것이 아니라 Vera Rubin 랙과 함께 작동하도록 설계됐다. 장문맥 처리, 토큰 생성, 네트워킹, 스토리지를 각기 적합한 구성요소에 맡기고 전체 시스템으로 공동 설계하는 방식이다. 대형 AI 클라우드와 기업 고객에게는 단일 칩 성능보다 이런 통합 구조가 더 중요할 수 있다.

NVIDIA는 Nebius를 첫 AI 클라우드 채택사로 지목했으며, Nebius가 Token Factory 추론 플랫폼에 Groq 3 LPX를 도입할 계획이라고 밝혔다. Groq도 초기 채택 기업으로 거론됐다. 클라우드에서 실제로 접근할 수 있어야 칩 발표가 개발자 경험으로 이어진다. 기업이 익숙한 API를 통해 더 빠른 에이전트 추론을 쓸 수 있다면 코드 에이전트, 연구 보조, 고객지원 자동화, 복잡한 사무 워크플로가 먼저 영향을 받을 수 있다.

이번 발표는 AI 지출에 대한 감시가 커지는 시점에 나왔다. 기업들은 훈련 클러스터와 데이터센터에 막대한 자본을 투입했지만, 실제 장기 비용은 배포 이후의 추론에서 계속 쌓인다. 사용자의 질문과 에이전트의 한 단계마다 비용이 발생한다. 낮은 지연 시간과 낮은 토큰 비용은 공학적 성과이자 사업 모델의 조건이다. Groq 3 LPX의 양산은 AI 하드웨어 경쟁이 더 큰 두뇌를 만드는 단계에서 배포된 지능을 하루 종일 쓸 만큼 빠르게 만드는 단계로 이동하고 있음을 보여준다.