AI Briefing

Hermes, NVIDIA RTX PC·DGX Spark 기반 자기개선 AI 에이전트

·2026.05.13 22:00

Hermes Agent가 NVIDIA RTX PC와 DGX Spark용 자기개선형 로컬 AI 에이전트로 소개됐다.

Hermes Agent는 Nous Research가 만든 오픈소스 에이전트 프레임워크로, 메시징 앱과 로컬 파일·애플리케이션을 연결해 24시간 상시 실행된다. GitHub star는 14만 개3개월도 안 돼 넘겼고, OpenRouter 기준으로는 지난주 세계에서 가장 많이 쓰인 agent로 소개됐다.

벤더·모델 비종속 구조를 택해 NVIDIA RTX PC, RTX PRO 워크스테이션, DGX Spark 같은 로컬 하드웨어와 잘 맞는다. 핵심 차별점은 다음 네 가지다.

  • Self-evolving skills: 복잡한 작업이나 피드백을 받을 때마다 배운 내용을 skill로 저장해 스스로 개선한다.
  • Contained sub-agents: 하위 작업을 짧게 사는 격리 worker로 분리해 작은 컨텍스트 윈도우에서도 깔끔하게 운영한다.
  • 설계 단계부터 신뢰성 확보: Nous Research가 skill, tool, 플러그인을 선별·스트레스 테스트해 로컬 모델에서도 안정성을 높였다.
  • 같은 모델, 더 나은 결과: 같은 모델을 써도 단순 wrapper보다 orchestration layer로 동작해 더 나은 결과를 내는 방향을 강조한다.

여기에 맞춰 AlibabaQwen 3.6 오픈웨이트 LLM이 로컬 agent용 모델로 제시됐다. Qwen 3.6 35B는 약 20GB 메모리로 동작하면서 **70GB+**가 필요한 120B급 모델을 넘는다고 설명했고, Qwen 3.6 27BQwen 3.5 397B 같은 400B급 모델과 비슷한 정확도를 노리면서 크기는 1/16 수준이다. NVIDIA Tensor Cores가 추론 지연을 줄여 멀티스텝 작업과 skill 재작성 속도를 높인다고 덧붙였다.

DGX Spark는 상시 agent 워크플로우를 위한 소형 독립 머신으로 포지셔닝된다. 128GB 통합 메모리와 1 petaflop AI 성능으로 120B급 MoE 모델을 하루 종일 돌릴 수 있고, 더 가벼운 Qwen 3.6 35B는 더 빠르게 실행돼 동시 작업 여유를 남긴다.

Hermes를 시작하려면 GitHub 저장소에서 내려받아 원하는 로컬 모델과 런타임에 연결하면 된다. llama.cpp, LM Studio, Ollama를 지원하고, Hermes Agent는 LM StudioOllama 통합을 기본 제공한다. 추가로 RTX PRO GPUs의 Qwen 3.6 토큰 생성 속도 최대 3배 향상, Gemma 4 NVFP4 체크포인트, Mistral Medium 3.5 호환, NemoClawWSL2 지원도 소개했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.