씨티의 Inference Ahead - 대규모 지능을 위한 기반(레일) 구축
씨티의 견해
제미나이 4 아르곤(Gemini 4 Argon, 9/30)은 AA에서 53점을 기록하며 페이블 5.1(Fable 5.1) 및 GPT-6 아스트라(GPT-6 Astra)와 같은 수준에 도달했습니다. 이 모델의 설계는 점점 더 커지는 소프트웨어 프로젝트 전반에서 다단계 작업을 수행하는 에이전트를 위한 모델을 구축하는 프론티어 추세를 확장한 것입니다. 또한 광범위한 출시가 지연된 것은, 수익화 이전에 공급자들이 안전장치를 강화하고 효율성을 개선할 시간을 더 확보할 수 있도록 하는 단계적 출시로의 업계 전반의 전환을 따르는 것입니다. 상위 10개 공급자 가운데 이전 모델 대비 지능을 향상시키면서 작업 비용을 낮춘 모델은 독점(proprietary) 모델뿐이었으며, 이는 독점 모델 공급자들 사이에서 가격 대비 성능에 대한 관심이 다시 높아지고 있음을 보여줍니다(그림 13). 공급자들의 다음 단계이자 다음 주 World Summit AI에서 주요 초점이 될 가능성이 높은 것은(그림 3) 더 긴 추론을 완료된 워크플로당 더 낮은 비용으로 전환하는 것입니다.
소비자. 상시 작동(always-on) 어시스턴트는 소비자 시장에서 보다 자율적인 AI를 빠르게 배포하는 수단이 되고 있습니다. 메타의 뮤즈(Muse)는 출시 22일 만에 미국 내 다운로드 500만 건을 달성했으며(TechCrunch, 9/21), 이는 ChatGPT의 초기 모바일 채택 곡선을 웃도는 속도였습니다. 채택이 가속화되고 있다는 점은 AI 제품이 세대를 거듭할수록 소비자 채널을 통해 더 빠르게 확산되고 있음을 시사합니다. 저희가 데카곤 다이얼로그스(Decagon Dialogues)에 참석했을 때, 기조연설에서는 델타(Delta)와 버라이즌(Verizon) 같은 고객사들이 탐색, 구매, 온보딩, 지원, 성장 전반에 걸친 AI 컨시어지에 강한 관심을 보이고 있다는 점이 공개되었습니다. 다만 기업들이 에이전트에게 어느 정도의 자율성을 부여할지 검토하고 있어 거버넌스는 여전히 주요 장애물로 남아 있습니다. 그 결과, 배포 일정이 근본적인 수요에 뒤처지더라도 기업용 에이전틱 시스템에는 상당한 장기적 기회가 존재합니다.
보안. 강화된 안전 및 증류 방지(anti-distillation) 조치(OpenAI, 9/30)는 사전학습 주기 사이의 과정을 계속 길어지게 할 수 있으며, 이로 인해 독점 모델 공급자들이 현재 오픈 모델 대비 보유한 12포인트의 지능 우위를 유지하기가 더 어려워질 수 있습니다(그림 8). 엔비디아의 런타임 및 DPU 제어 기능(9/28)은 기업들이 점점 더 모델 외부에서 신원, 권한, 격리, 감사를 시행하게 될 것임을 시사합니다. 구글의 페어윈드 프로그램(Fairwind Program)은 프론티어 연구소들이 제한적 접근 모델을 검증된 방어자들과 짝지어 운영하는 방식을 보여주며, 이는 통제된 접근을 경쟁 우위로 만들 가능성이 있습니다.
활용률. H100과 B200의 임대 가격은 전주 대비 각각 2.2%, 2.8% 상승한 반면 B300은 6.5% 하락하여, B200 대비 B300의 프리미엄이 56% 축소되었습니다(그림 20). 이러한 전주 대비 수렴은 활용률 측면에서 긍정적입니다. H100과 B200의 견조한 가격은 설치된 용량에 대한 수요가 지속되고 있음을 시사하며, B300 프리미엄 하락은 배포가 따라잡음에 따라 차세대 제품 채택을 가속화할 것입니다. 한편 컨텍스트 언어 모델(Context Language Models, 그림 2)은 모델이 자체 컨텍스트를 능동적으로 관리하고 업데이트할 수 있게 함으로써 아키텍처 발전이 소프트웨어 효율성을 어떻게 개선할 수 있는지 보여주며, FLOPs를 59% 줄이면서도 12시간 에이전트 점수를 5% 높였습니다. 또한 메타의 Suffix Cache Reuse(접미사 캐시 재사용)는 성능에 영향을 주지 않으면서 서버 측 연산을 35% 절감하여, 새로운 에이전틱 워크로드를 실현 가능하게 하는 데 기여하고 있습니다.
