하이프 이후의 엔터프라이즈 AI
핵심 내용
2025년 엔터프라이즈 AI의 승부는 모델 성능보다 시스템 설계였다.
자세히 보기
2025년에는 최상위 LLM 성능이 크게 도약하지는 않았지만, 실제 조직 안에서 AI가 작동하려면 무엇이 필요한지 분명해졌다. 벤치마크 점수는 높았고 모델 간 격차도 줄었지만, 그 결과가 곧바로 비즈니스 성과로 이어지지는 않았다.
그래서 기업들은 공개 리더보드보다 내부 평가에 더 의존하기 시작했다. 각자의 업무 흐름에서 만든 테스트셋과 내부 데이터 자산으로 종단 간 성능을 검증하면서, 모델을 고르는 기준도 외부 순위가 아니라 자사 워크플로에 맞는지로 바뀌었다.
기술의 중심도 단일 모델의 추론에서 AI 시스템으로 이동했다. 도구 사용, 지속적 컨텍스트, 검색(retrieval), 단계별 실행과 중간 검증을 결합해 한 번에 끝내지 못하는 일을 끝까지 처리하는 방식이 중요해졌다. 인시던트 조사, 정책에 근거한 고객 응대, 스펙을 실제 코드로 바꾸는 작업이 대표적이다.
기업 도입은 여전히 내부 사용 사례에 집중됐다. 특히 RAG 파이프라인을 기반으로 한 사내 Q&A, 고객 지원, 코딩 어시스턴트가 주류였고, 에이전트는 화제성만큼 널리 확산되지는 못했다. 일부 좁은 업무에서는 성과가 있었지만, 광범위한 자율성은 여전히 제한적이었다.
ROI 압박이 커지면서 SLM(Special or Small Language Models) 의 가치도 커졌다. 빠르고 저렴하며 일관성이 필요한 가드레일, 정책 집행, 보안, 콘텐츠 모더레이션 같은 영역에서는 SLM이 오히려 더 적합했다. 동시에 오케스트레이션이 중요해지면서, 여러 하위 에이전트와 모델을 라우팅하는 조정 계층이 사실상 시스템의 핵심이 됐다.
오픈소스 생태계도 갈라졌다. Kimi K2, Qwen, Deepseek 같은 중국계 모델은 더 강해진 반면, 서구권의 공개 모델은 줄어드는 흐름이 나타났다. 비용과 수익성 압박 속에서 기업들은 데이터의 중요성을 다시 인식했고, Gemini 3처럼 일부 모델만 공개 평가에서 두드러진 성과를 보였다. 2026년에는 더 많은 혁신과 마케팅이 쏟아지겠지만, 결국 성패를 가르는 것은 모델 하나가 아니라 데이터, 평가, 오케스트레이션이 결합된 시스템 설계다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.