출처

개요

SurfSense는 Reddit, YouTube, TikTok, Google Search, Google Maps 등에서 실시간 웹 데이터를 수집해 AI 에이전트가 활용할 수 있도록 제공하는 오픈소스 리서치 플랫폼입니다. 플랫폼별 전용 커넥터가 게시물, 댓글, 자막, 리뷰, 검색 결과 등을 구조화된 JSON으로 반환하며, REST API와 MCP 서버를 통해 사용할 수 있습니다. 기존 NotebookLM 스타일의 지식 베이스, 인용 기반 채팅, 리포트, 팟캐스트, 자동화 기능도 함께 제공합니다. Docker 기반 자체 호스팅과 Ollama·vLLM을 통한 로컬 모델 구성을 지원하지만, 개발팀은 아직 프로덕션 준비가 완료된 상태는 아니라고 밝히고 있습니다.

핵심 포인트

  • Reddit, YouTube, Instagram, TikTok, Amazon, Walmart, Google Maps, Google Search, Indeed 및 일반 웹 페이지를 위한 커넥터를 제공합니다.
  • 각 커넥터는 게시물·댓글·자막·리뷰·검색 결과 등을 구조화된 데이터로 반환하며, surfsense_reddit_scrape, surfsense_google_search와 같은 MCP 도구로 노출됩니다.
  • REST API 또는 MCP 서버를 통해 Claude, Cursor, 자체 에이전트 프레임워크 등에 연결할 수 있습니다.
  • Notion, Slack, Jira 등 외부 MCP 커넥터를 OAuth 방식으로 연결할 수 있으며, 클라우드 사용량은 반환된 항목과 성공적으로 수집한 페이지를 기준으로 과금됩니다.
  • 자체 호스팅 시 과금 기능이 꺼진 상태로 사용할 수 있고, Docker 및 Docker Compose 설치 방식을 지원합니다.
  • PDF·오피스 문서·이미지·오디오와 클라우드 드라이브 자료를 통합하고, 의미 기반 검색과 전문 검색을 결합한 하이브리드 검색 및 출처 인용을 제공합니다.
  • 저장소의 일반 코드는 Apache License 2.0이지만 surfsense_backend/app/proprietary/ 아래 코드는 Business Source License 1.1이 적용되므로 사용 전 라이선스를 구분해 확인해야 합니다.

왜 중요한가

정적 문서 검색만으로는 제품에 대한 최신 사용자 반응, 채용 공고, 상품 리뷰와 같은 변화하는 웹 정보를 에이전트가 활용하기 어렵습니다. SurfSense는 이러한 데이터를 플랫폼별 커넥터와 MCP 인터페이스로 제공해, 웹 수집·정규화·에이전트 연결을 직접 구현해야 하는 부담을 줄이는 접근을 제시합니다. 다만 데이터 수집 대상의 이용약관·접근 제한, 커넥터 안정성, BSL 적용 범위, 아직 프로덕션 준비가 되지 않았다는 프로젝트의 자체 평가를 함께 고려해야 합니다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-30-pytorchkr-topic-11459-surfsense-notebooklmsource_url 및 HTML 원문과 함께 저장되어 있습니다.