AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#swe-bench
#swe-bench와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Taste-Bench, 프런티어 LLM의 장기 작업 의사결정 정확도 59.7% 기록
TLDR AI
·
2026.09.25 09시
UiPath, 에이전트 작업 길이별 Claude 모델 성능 격차 공개
Reddit
·
2026.09.22 21시
OpenAI SWE-bench 보고 중단·권고, 해결책은 '평가자 주도 검증'
Reddit
·
1
·
2026.09.20 23시
병렬 에이전트, 코딩엔 역효과
Reddit
·
2026.09.05 08시
Agent Lightning v1.0: Harnessed Agentic RL로 나아가다
TLDR AI
·
2026.08.20 09시
Ramp SWE-Bench (3분 읽기)
TLDR AI
·
2026.08.03 09시
SWE Tasks에서 13개 모델과 4개 에이전트 비교: Go, Java, Python, Rust, TS
Hacker News
·
2026.08.01 00시
에이전트 성능 저하 없는 컨텍스트 압축 도구 Distil 공개
Reddit
·
1
·
2026.07.26 08시
SWE-Pruner Pro: 에이전트 내부 표현을 활용한 컨텍스트 프루닝
Reddit
·
2026.07.21 19시
도구 사용 능력을 갖춘 LLM 에이전트의 취약점 측정
TLDR AI
·
2026.06.26 09시
Microsoft, 코드 에이전트용 FastContext 공개
Reddit
·
2026.06.23 09시
Ramp SWE-Bench: 실제 프로덕션 환경에 기반한 프라이빗 코딩 벤치마크
TLDR AI
·
2026.06.15 09시
Qwen3.7: 에이전트 최전선
Qwen
·
1
·
2026.05.20 11시
Adaption, 모델이 스스로 학습하도록 돕는 AI 도구 AutoScientist 공개
TLDR AI
·
2026.05.14 09시
Laguna XS.2와 M.1: 심층 분석
TLDR AI
·
2026.04.29 09시
SWE-bench Verified가 더 이상 프런티어 코딩 역량을 측정하지 못하는 이유
GeekNews
·
2026.04.27 18시
SWE-bench 오염 확인
Reddit
·
2026.04.27 03시
mini-swe-agent - GitHub 이슈 해결 및 커맨드라인 지원을 위한 100줄짜리 AI 에이전트
GeekNews
·
2026.04.26 09시
Kimi Vendor Verifier - 추론 제공자의 정확성 검증
GeekNews
·
2026.04.23 03시
Moonshot AI, Kimi Chat과 API에 Kimi K2.6 출시
TLDR AI
·
2026.04.21 09시
MoE가 뒤집었다
Reddit
·
2026.04.18 02시
Opus 4.7 장문 회귀
Reddit
·
2026.04.17 00시
골드 같은 답변이 만드는 벤치마크 왜곡
AI21 Labs
·
2026.04.14 20시
AI agent 벤치마크를 무너뜨린 방법과 다음 단계
GeekNews
·
1
·
2026.04.12 21시
이전
1
2
다음
이전
1
2
다음
#swe-bench | AI Briefing