상위 허브: AI Models

상위 MOC의 탐색성을 유지하기 위해 날짜별 신규 유입·고아 정리 섹션 70개 링크를 내용 변경 없이 분리한 유지보수 아카이브.

2026-04-24 ~ 04-28 신규

노트설명
2026-04-24-openrouter-model-pricing-comparisonOpenRouter 최근 출시 모델들의 API 가격·컨텍스트 윈도우 비교표
2026-06-26-openrouter-list-benchmarks-api-referenceOpenRouter GET /api/v1/benchmarks — Artificial Analysis·Design Arena 통합 벤치마크 API reference
2026-05-08-omniroute무료 AI gateway, 160+ providers, 13 routing strategies
2026-04-24-cloudflare-unweight-lossless-llm-compressionexponent Huffman coding으로 LLM 크기 22% 감소 — batch 1 처리량 41% 오버헤드
2026-04-24-threads-choi-openai-deepseek-v4-openweightsDeepSeek-V4 오픈웨이트 발표 — 100만 토큰·Think Max 주장, 검증 필요
2026-04-25-ai-model-category-picks2026-04-25 기준 카테고리별 최고 AI 모델 셀렉션
2026-04-26-nemotron-personas-korea국내 최초 대규모 한국어 페르소나 데이터셋 (700만 페르소나, 17억 토큰)
2026-04-27-mac-96gb-llm-recommendationMac 96GB+ Local LLM — Qwen3.6-27B보다 DeepSeek V4 Flash MLX·Minimax M2.7 우위
2026-04-26-swiftlm-apple-silicon-inferenceApple Silicon 네이티브 MLX 추론 서버, SSD Streaming + TurboQuant
2026-04-26-openai-monitorability-evalsOpenAI CoT 모니터링 기반 안전 평가 데이터셋/코드 공개
2026-04-26-local-llm-formats-comparisonMLX vs GGUF vs nvfp — 로컬 LLM 포맷별 용도·장단점 비교
2026-05-12-rapid-mlx-apple-silicon-local-ai-engineRapid-MLX — Apple Silicon 전용 초고속 로컬 AI 엔진
2026-05-19-whichllmwhichllm — 하드웨어 기반 로컬 LLM 추천 CLI
2026-05-12-llama-cpp-ollama-lmstudio-rapid-mlx-comparisonllama.cpp / Ollama / LM Studio / Rapid-MLX 비교 노트
2026-05-28-xiaomi-mimo-v2-5-price-cut-99-percentXiaomi MiMo-V2.5 API 최대 99% 영구 인하 — 딥시크 겨냥 가격 경쟁

2026-07-18 신규 유입 (고아 정리)

노트설명
2026-03-29-llm-ensemble-voting-research연구 결과에 따르면, 여러 Large Language Model (LLM)의 출력을 voting 방식으로 결합하는 ensemble 방식은 단일 모델보다 정확도, 견고성, 신뢰성을 유의미하게 향상시킵니다.
2026-04-13-ai-expert-sources1. Anthropic 공식 블로그/유튜브 — Claude, 에이전트, 안전성 관련 최신 연구 2. 유튜브 ‘AI Engineer’ 채널 — AI 엔지니어링 실무 심층 콘텐츠 3. Lenny’s Podcast — 제품/성장 관점의 AI 인사이트 4. How I AI with Claire Vo — AI 실전 활용 인터뷰…
2026-04-19-openmythos-recurrent-depth-transformerClaude Mythos는 수백 개의 고유한 레이어를 쌓는 대신, 일부 레이어를 재활용하여 순간 전파(foreward pass) 동안 여러 번 실행하는 Looped Transformer일 가능성이 있다.
2026-04-19-supergemma4-e4b-abliterated무검열(abliterated) 처리 후 성능 저하를 복구해 4~16GB VRAM에서도 구동 가능하다고 소개된 경량 로컬 LLM 모델 SuperGemma4-E4B 요약.
2026-05-02-anthropic-knowledge-distilation-student-modelsAnthropic이 방금 전 세계 모든 AI 기업을 공포에 빠뜨렸습니다.
2026-05-06-dflash-gemma4-6x-fasterGemma 4는 가장 최적화된 무료 오픈소스 로컬 AI로 알려져 있으며, 오래된 노트북과 스마트폰에서도 동작한다.
2026-05-06-glm51-uncensored-security-test검열이 해제된 GLM-5.1 모델을 격리된 샌드박스 환경에서 실행하며, 모델이 자체 프로그램에 대해 보안 공격을 수행할 수 있는지 테스트했다.
2026-07-03-pytorchkr-topic-11058-tabfm-zero-shot-tabular-foundation-modelGoogle Research가 공개한 TabFM(Tabular Foundation Model)은 표 형식 데이터의 분류와 회귀를 별도의 학습이나 하이퍼파라미터 탐색 없이 단 한 번의 순전파로 처리하는 제로샷 파운데이션 모델이다.
2026-07-03-pytorchkr-topic-11065-anthropic-claude-fable-5-free-usage-promotionAnthropic의 최상위 모델 Claude Fable 5가 미국 수출통제 조치 해제(6/30)로 7월 1일 전 세계에 재배포되었습니다.
2026-07-05-all-rl-algorithms-from-scratchAll RL Algorithms from Scratch는 강화학습(RL) 알고리즘 18가지를 파이썬으로 직접 구현한 교육용 GitHub 저장소다.
2026-07-07-pytorchkr-topic-11090-skillcomposer-llm-agent-skill-composition-research스킬 라이브러리가 커질수록 ‘어떤 스킬을, 몇 개나, 어떤 순서로 쓸지’를 정하는 조합 선택이 추론 병목이 되고 있다.
2026-07-08-pytorchkr-topic-11121-xybrid-on-device-llm-voice-ai-runtimeXybrid는 LLM, 음성 인식(ASR), 음성 합성(TTS)을 클라우드 서버가 아니라 사용자 기기에서 직접 실행하기 위한 크로스플랫폼 런타임이다.
2026-07-08-pytorchkr-topic-11147-tencent-hy3-295b-open-source-moe-modelTencent Hy3는 텐센트 훈위안(Tencent Hy, 구 Hunyuan) 팀이 공개한 Apache 2.0 라이선스의 오픈소스 대규모 언어 모델이다.
2026-07-09-pytorchkr-topic-11161-deepteam-llm-agent-red-teaming-frameworkDeepTeam은 LLM 애플리케이션과 AI 에이전트를 대상으로 탈옥, 프롬프트 주입, 멀티턴 공격 등을 시뮬레이션하는 오픈소스 레드팀 프레임워크다.
2026-07-10-pytorchkr-soma-unified-body-layerSOMA는 NVIDIA DAIR Lab이 제안한 통합 바디 레이어로, SMPL·SMPL-X·MHR·Anny·GarmentMeasurements 등 서로 다른 인체 파라메트릭 모델을 하나의 표준 메시와 77관절 리그로 연결한다.
2026-07-10-pytorchkr-topic-11183-jobs-ai-exposure-us-job-market-visualizerAndrej Karpathy가 공개한 jobs는 미국 노동통계국(BLS)의 Occupational Outlook Handbook이 다루는 342개 직업을 인터랙티브 트리맵으로 탐색하는 개발·연구 도구다.
2026-07-12-pytorchkr-topic-11217-ai-2040-plan-a초지능 경쟁을 2040년까지 늦추고 연구 투명성·검증·컴퓨트 상호억제를 도입하자는 정책 권고 시나리오.
2026-07-13-pytorchkr-topic-11208-talk-normal-llmtalk-normal: 어떤 LLM이든 장황한 답변을 간결하게 만드는 시스템 프롬프트
2026-07-14-pytorchkr-topic-11221-colibri-744b-moePyTorchKR에서 소개한 colibri-744b-moe 관련 자료를 정리한 요약 노트.
2026-07-14-pytorchkr-topic-11235-lotus-llmLOTUS: 데이터에 LLM과 에이전트 처리를 대규모로 적용하는 시맨틱 연산자 프레임워크
2026-07-15-pytorchkr-topic-11250-sensorfm-health-foundation-modelPyTorchKR에서 소개한 sensorfm-health-foundation-model 관련 자료를 정리한 요약 노트.
2026-07-16-bonsai-27b-low-bit-on-device-llmBonsai 27B는 Qwen3.6-27B를 이진·삼진 가중치로 변환해 노트북과 스마트폰에서 실행하려는 PrismML의 저비트 LLM 연구다.
2026-07-17-inkling-open-weights-modelThinking Machines의 오픈웨이트 모델 Inkling은 최고 성능보다 토큰 효율·멀티모달 처리·파인튜닝 가능성을 앞세운다.
[[summaries/2026-07-18-claude-fable-5-system-prompt2026-07-18-claude-fable-5-system-prompt]]

2026-07-20 신규 유입 (고아 정리)

노트설명
2026-07-12-artificial-analysis-gpt-5-6-intelligence-vs-costArtificial Analysis의 Intelligence vs Cost 차트에서 GPT-5.6 Sol·Luna가 모든 추론 강도 구간에서 Terra를 파레토 우위로 앞선다는 트윗 요약.
2026-07-12-sebastian-raschka-grok-4-5-pareto-frontierSebastian Raschka가 Grok 4.5와 Meta Muse Spark 1.1을 추가한 지능-비용 비교 차트를 공개, Grok 4.5의 가성비를 지목.
[[summaries/2026-07-19-aisparkup-post-14555-27b-ai-prismml2026-07-19-aisparkup-post-14555-27b-ai-prismml]]
[[summaries/2026-07-20-ai-frontier-ep104-gpt5-6-icml2026-07-20-ai-frontier-ep104-gpt5-6-icml]]
[[summaries/2026-07-20-aisparkup-post-14587-ai-3-12026-07-20-aisparkup-post-14587-ai-3-1]]
[[summaries/2026-07-20-pytorchkr-topic-11308-nvidia-rteb-1-nemotron-3-embed-feat-rag2026-07-20-pytorchkr-topic-11308-nvidia-rteb-1-nemotron-3-embed-feat-rag]]
[[summaries/2026-07-20-pytorchkr-topic-11311-diffusion-llm-llada-diffusiongemma2026-07-20-pytorchkr-topic-11311-diffusion-llm-llada-diffusiongemma]]
[[summaries/2026-07-20-pytorchkr-topic-11323-pike-rag-microsoft-rag2026-07-20-pytorchkr-topic-11323-pike-rag-microsoft-rag]]
[[summaries/2026-07-20-pytorchkr-topic-11328-2026-07-13-19-ai-ml2026-07-20-pytorchkr-topic-11328-2026-07-13-19-ai-ml]]

2026-07-20 신규 유입 (고아 정리, 3차)

노트설명
2026-05-02-gpt-5-5-claude-opus-4-7-opposite-prompt-adviceOpenAI와 Anthropic이 같은 날 낸 프롬프트 엔지니어링 가이드가 서로 반대 조언을 담고 있어 개발자들이 혼란을 겪었다는 X 스레드.
2026-06-30-unlimited-ocr-fixed-kv-cache-long-document-baidu바이두 Unlimited OCR — Reference Sliding Window Attention으로 디코더 KV 캐시를 상수로 묶어 40페이지 이상 문서를 한 번에 OCR.

2026-07-26 신규 유입

노트설명
[[summaries/2026-07-26-ai-frontier-ep105-can-ai-do-research2026-07-26-ai-frontier-ep105-can-ai-do-research]]

2026-07-28 신규 유입

노트설명
2026-07-28-sam-altman-agi-compute-human-agency샘 올트먼(OpenAI) — 지능은 커모디티가 되고 컴퓨트 함대만 해자로 남는다, 허깅페이스 제로데이 사건, 지니와 권력 집중, 로보틱스 2~3년.
[[summaries/2026-08-01-x-unslothai-deepseek-v4-flash-07312026-08-01-x-unslothai-deepseek-v4-flash-0731]]

2026-08-04 신규 유입

노트설명
[[summaries/2026-07-26-ai-frontier-ep106-intelligence-supply-war2026-07-26-ai-frontier-ep106-intelligence-supply-war]]
[[summaries/2026-08-02-ai-frontier-ep107-unpredictable-future2026-08-02-ai-frontier-ep107-unpredictable-future]]

2026-08-08 신규 유입

노트설명
2026-08-08-github-kyutai-labs-pocket-ttsKyutai Pocket TTS — CPU에서 실행되는 100M 파라미터·24kHz streaming·voice cloning Python TTS
2026-08-13-github-openbmb-voxcpmOpenBMB VoxCPM2 — AudioVAE latent·MiniCPM·LocDiT를 결합한 tokenizer-free 다국어 TTS

2026-08-17 신규 유입

노트설명
2026-08-17-ai-frontier-ep109-inference-eraSionic의 B300 토큰 팩토리 — 1000 TPS·speculative decoding·prefill/decode 분리와 인퍼런스 자본의 가치 이동

2026-08-18 신규 유입

노트설명
2026-08-18-ai-frontier-ep110-ai-alignment모델 출시 타임라인, post-training·재귀적 자기개선·reasoning trace·모델 증류와 오정렬 위험을 함께 다룬 대담

2026-08-22 신규 유입

노트설명
2026-08-22-gpt-astra-claude-opus-6-rumorsGPT Astra·Claude Opus 6 출시 루머, Codex 1M 컨텍스트 설정, Qwen3.8·DeepSeek V4 Pro의 프론티어 추격 주장

2026-08-23 신규 유입

노트설명
[[summaries/2026-08-23-linkedin-sujin-kang-llm-judge-self-preference2026-08-23-linkedin-sujin-kang-llm-judge-self-preference]]
2026-08-23-kang-sujin-reasoning-prompt-strategy추론 모델 시대에 ‘너무 오래 걸려·토큰 많이 써’ 문제를 목표·성공기준·early stop·추론 강도 조절과 모델별 프롬프트 설계로 푸는 전략

2026-08-25 신규 유입

노트설명
2026-08-25-ai-frontier-ep111-dokpamo-raceAAII 1위 Motif의 독파모 탈락을 정부 평가표·실사용·소버린 AI 관점에서 분석하고 continual learning·평가 루프까지 연결한 대담

2026-09-03 신규 유입

노트설명
2026-09-03-ai-frontier-ep112-kv-cache-rooflineKV cache·Roofline·prefill/decode 분리와 서빙 스케줄링으로 AI 반도체의 인퍼런스 병목을 읽는 강연

2026-09-10 신규 유입 (X 북마크)

노트설명
2026-09-10-deepseek-v4-1-flash-releaseDeepSeek V4.1 Flash 출시와 오픈웨이트 밈·OpenDesign 98% 벤치·텐센트 0.03x 가격전·OpenCode 데이0 지원
2026-09-10-astra-xhigh-cost-usageAstra effort별 실사용량 역전 — xHigh 65턴 vs Medium 122턴과 ARC-AGI-3 벤치비용표

2026-09-11 신규 유입 (X 북마크)

노트설명
2026-09-11-astra-ops-costAstra 쿼터 이월·88% 혼용 절감·8역할 백오피스·effort 6단계 토큰표
2026-09-11-deepseek-harness-flashHarness v0.1.5 공동학습과 V4.1 Flash 결합 지침·무료 라우터
2026-09-11-threads-astra-xhigh-sol-splitxhigh 설계·검수+Sol medium 코딩 2배 체감 분업

2026-09-10 신규 유입 (Threads 저장)

노트설명
2026-09-10-threads-qwen3-8-27b-local-piQwen3.8-27B+Pi 로컬 기본 모델과 xhigh 추론 함정
[[summaries/2026-09-10-threads-artificial-analysis-4-22026-09-10-threads-artificial-analysis-4-2]]
[[summaries/2026-09-10-threads-glm-flash-free-window2026-09-10-threads-glm-flash-free-window]]
[[summaries/2026-09-10-threads-fable-vs-astra-notes2026-09-10-threads-fable-vs-astra-notes]]

2026-09-12 신규 유입 (YouTube)

노트설명
2026-09-12-ai-frontier-ep114-no-escapeNavier–Stokes 대규모 멀티에이전트 연구, GPT Image 2.5·Astra, AlphaGenome Atlas를 엮어 본 frontier AI 뉴스와 검증 경계