출처

개요

BigSet은 원하는 데이터를 평범한 문장으로 설명하면 자율 에이전트가 살아 있는 웹을 조사해 검증된 구조화 데이터셋으로 만들어주는 도구다. 예를 들어 “현재 엔지니어를 채용 중인 YC 회사와 그 회사의 펀딩 단계, 위치, 열려 있는 채용 공고 수”라는 문장을 입력하면 스키마를 자동 추론하고 개체를 조사·검증·중복 제거한 뒤 표로 돌려준다. 개발사 TinyFish는, 스크래핑 프레임워크·검색 API·사이트별 액터 등 부분 문제를 잘 푸는 도구는 많지만 여러 범주를 가로지르는 데이터가 필요할 때는 검색·추출·스키마 설계·중복 제거·검증·갱신 크론까지 매번 직접 엮어야 하는 간극을 BigSet이 메운다고 설명한다. 다만 실험 단계(experimental) 프로젝트임을 명시하고 있다 — 기능이 깨지고 바뀔 수 있음.

핵심 포인트

  • 6단계 파이프라인: 문장으로 설명 → AI가 열 이름·타입·기본 키·웹 조사 범위를 추론하는 스키마 추론 → 오케스트레이터 에이전트가 웹 검색으로 채울 개체를 찾음 → 서브 에이전트들이 병렬로 각자 개체 하나씩 조사·검증해 표에 행 삽입 → 구조화 표(UI 열람, CSV/XLSX 내보내기) → 갱신 주기 설정 시 에이전트가 주기적으로 재실행해 최신 상태 유지.
  • 기술 스택: 데이터 수집은 TinyFish의 Search·Fetch·Browser API, AI 오케스트레이션은 Mastra 워크플로우+Vercel AI SDK, 스키마 추론·채우기 에이전트는 OpenRouter 경유 Claude Sonnet, 데이터베이스는 자체 호스팅 Convex.
  • 설치·사용: Node.js 22+ 필요(Docker 불필요), npm install --global @adamexu/bigsetbigset 실행 시 로컬 백엔드·프런트엔드가 뜨고 127.0.0.1:3500에서 접속. 첫 실행 시 TinyFish(웹 검색·페이지 가져오기)와 OpenRouter(LLM 호출) API 키 설정, 키는 OS 키체인에 저장. CLI 명령(bigset create "fintech startups in the bay area" --rows 10 --wait --csv fintech.csv, bigset list/status/export)은 Codex·Claude Code 같은 코딩 에이전트도 그대로 호출 가능. --cadence manual|30m|6h|12h|daily|weekly로 갱신 주기 지정.
  • 한계(개발팀 자체 고지): 실험 단계라 스키마 추론이 항상 완벽하지 않음, 데이터셋 생성에 보통 2~5분 소요(실제 검색·페치·검증 수행), 로그인·페이월 뒤 데이터는 다룰 수 없음(공개 웹 데이터에서 최적), 현재는 열람·내보내기만 가능하고 SQL 질의는 로드맵 예정.
  • 라이선스: AGPL-3.0(강한 카피레프트 — 수정 버전을 네트워크 서비스로 제공해도 소스 공개 의무).

왜 중요한가

“자연어 한 문장 → 스키마 추론 → 병렬 조사 에이전트 → 검증된 표”라는 파이프라인은 전통적 웹 스크래핑 워크플로(수작업 스키마 설계·크롤러 작성·중복 제거 로직)를 에이전트가 대체하는 구체적 사례다. 특히 CLI가 코딩 에이전트에서 직접 호출 가능하도록 설계된 점은, “리서치 에이전트의 하위 도구”로 다른 에이전트 워크플로에 조합될 잠재력을 보여준다.

더 읽어보기 (원문 인용)

참고 링크

관련 위키