AI Briefing

데이터 구축 프레임워크 SyGra 공개

SyGra: The One-Stop Framework for Building Data for LLMs and SLMs

·2025.09.22 15:45

LLM 및 SLM 학습을 위한 데이터 생성, 변환, 정렬을 지원하는 저코드 프레임워크 SyGra가 공개되었다.

SyGra는 LLM 및 SLM 구축 과정에서 발생하는 다양한 데이터 관련 문제를 해결하기 위한 저코드/노코드(low-code/no-code) 프레임워크다. 복잡한 스크립트 작성 대신 프롬프트 엔지니어링에 집중하여 고품질의 데이터를 생성할 수 있도록 돕는다.

주요 지원 기능은 다음과 같다:

  • 데이터 변환 및 생성: 지식 베이스를 Q&A 형식으로 변환하거나, SFT 데이터를 DPO용 선호 쌍(preference pairs)으로 생성한다.
  • 추론 및 품질 강화: 모델의 추론 능력을 높이기 위한 단계별 사고(reasoning) 데이터 생성 및 저품질 샘플 필터링을 지원한다.
  • 도메인 및 컨텍스트 확장: 특정 도메인 미드 트레이닝(mid-training)을 위한 데이터 큐레이션과 RAG 최적화를 위한 대규모 컨텍스트 데이터 구축이 가능하다.

또한, vLLM, Hugging Face TGI, Triton, Ollama 등 다양한 인퍼런스 백엔드와 호환되어 기존 ML 워크플로우에 쉽게 통합할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.