GitHub Copilot CLI, 서로 다른 모델 패밀리로 '두 번째 의견' 제공
핵심 내용
Copilot CLI가 다른 AI 패밀리의 검토를 더해 계획·코드 오류를 줄인다.
자세히 보기
GitHub Copilot CLI가 실험 모드에서 Rubber Duck을 도입해, 주 모델과 다른 AI 패밀리의 모델로 한 번 더 검토하는 구조를 넣었다. 계획 수립, 복잡한 구현, 테스트 작성 뒤 같은 모델의 자기검토 한계를 보완하는 것이 핵심이다.
핵심은 독립적인 두 번째 시각이다. Claude 계열을 오케스트레이터로 쓸 때 Rubber Duck은 GPT-5.4로 동작하며, 반대로 다른 모델 조합도 계속 실험 중이다. 단순한 자기반성보다 서로 다른 학습 편향과 사각지대를 가진 모델이 계획의 허점, 엣지 케이스, 파일 간 충돌을 더 잘 잡아낼 수 있다는 판단이다.
평가 결과도 이를 뒷받침한다. Claude Sonnet 4.6 + GPT-5.4 Rubber Duck 조합은 Claude Opus 4.6 단독과의 성능 격차를 74.7% 메웠고, 특히 3개 이상 파일을 건드리며 70단계 이상 가는 어려운 작업에서 Sonnet 기준 3.8% 개선, 세 차례 실험에서 가장 어려운 문제군에서는 4.8% 개선을 보였다.
Rubber Duck이 자동으로 개입하는 지점은 다음과 같다.
- 계획 작성 후: 초기에 잘못 잡은 구조가 이후 작업 전체로 번지는 것을 막는다.
- 복잡한 구현 후: 다중 파일 변경에서 놓친 의존성과 엣지 케이스를 찾는다.
- 테스트 작성 후, 실행 전: 커버리지 공백이나 잘못된 assertion을 미리 걸러낸다.
실제 사례로는 스케줄러가 실행 직후 종료되는 설계 문제, 반복문이 같은 dict 키를 덮어써 Solr facet 카테고리 3개가 사라지는 버그, Redis 키를 더 이상 쓰지 않으면서 이메일 확인 흐름이 깨지는 교차 파일 충돌 등이 제시됐다. 사용자는 /experimental로 기능을 켜고, 필요하면 언제든지 수동으로도 비판과 수정을 요청할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.