Crawlee, AI/LLM용 데이터 수집 라이브러리 공개
Crawlee: AI와 LLM을 위한 데이터를 수집하는 Node.js 웹 스크래핑 라이브러리
·2026.07.25 12:30
LLM 및 RAG 파이프라인 구축을 위한 고성능 Node.js 웹 스크래핑 라이브러리 Crawlee를 소개한다.
Apify에서 개발한 Crawlee는 AI, LLM, RAG 모델 학습 및 활용에 필요한 데이터를 효율적으로 수집하기 위한 Node.js 기반의 웹 스크래핑 라이브러리입니다.
핵심 특징은 다음과 같습니다:
- 하이브리드 크롤링 방식: 가벼운 HTTP 크롤링(Cheerio, JSDOM 활용)과 자바스크립트 렌더링이 필요한 사이트를 위한 브라우저 크롤링(Playwright, Puppeteer 활용)을 하나의 인터페이스로 지원합니다.
- 봇 차단 회피: 사람처럼 동작하도록 설계되어 최신 봇 보호 장치를 우회하며, HTTP2 지원 및 브라우저 TLS 지문(fingerprint) 복제 기능을 제공합니다.
- 운영 자동화 기능: 요청 큐 관리(영속적 큐), 자동 스케일링, 프록시 로테이션, 오류 재시도 및 데이터 저장소 플러그인을 통합적으로 제공합니다.
- 유연한 환경: Node.js 환경을 기반으로 하며, 파이썬 사용자를 위한 Crawlee for Python도 별도로 제공됩니다.
Apache 2.0 라이선스로 공개되어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.