LLM, 모델 아키텍처, 벤치마크 관련 노트 모음


모델

노트설명
2026-04-03-spreadsheet-terminal-benchAI 에이전트 벤치마크 (Kevin Gu)
2026-03-22-chatgpt-thinking-mode-model-sizeChatGPT Thinking Mode - 모델 체급에 따른 특성과 한계
2026-05-28-llm-model-release-timelineLLM 모델 출시 타임라인 — Claude & GPT (루머 포함)
2026-03-22-cloudflare-workers-ai-large-modelsCloudflare Workers AI — 엣지에서 대형 모델 실행
2026-03-22-github-trending-vllm-project-vllm-omnivLLM Omni — 멀티모달 모델 서빙
2026-03-24-iphone-400b-llmiPhone에서 400B LLM 구동
2026-03-26-qwen3.5-27b-claude-opus-distilled-v2Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2
2026-03-29-minimax-glm-kimi-coding-comparisonMiniMax m2.7 vs GLM-5.1 vs Kimi k2.5 — 코딩 성능 비교
2026-05-19-karpathy-joins-anthropicKarpathy의 Anthropic 합류 — 의미와 파급력
2026-03-31-karpathy-litellm-dependencies-reevaluationGolang 철학 vs Python 의존성 체인 (LiteLLM 사건 이후)
2026-04-05-qwen3-6-plusQwen3.6-Plus
2026-04-16-qwen3-6-35b-a3bQwen3.6-35B-A3B — Qwen의 35B 멀티모달 에이전틱 코딩 모델
2026-04-22-qwen3-6-27b-open-source-agentic-codingQwen3.6-27B — compact size flagship coding, terminal-level agentic coding
2026-04-22-xiaomi-mimo-v2-5-open-source-agents-forwardXiaomi MiMo-V2.5 — 오픈소스 에이전트/장기 실행 작업 강화 모델
2026-04-17-lyra-2-0Lyra 2.0 — 단일 이미지에서 탐색 가능한 3D 월드를 생성하는 NVIDIA 프레임워크
2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generationJoyAI-Echo — 최대 5분 멀티샷 오디오-비디오 생성 모델
2026-04-05-mac-mini-ollama-gemma4-setupMac mini Ollama + Gemma 4 설정
2026-04-08-gemma4-openclaw-ollama-3stepsGemma 4 + OpenClaw 3단계 로컬 구동
2026-04-15-supergemma4-geeknews-coverageSuperGemma4 GeekNews coverage — Gemma 4 26B 비검열/속도개선/양자화 소개
2026-04-08-claude-mythos-preview-benchmarksClaude Mythos Preview 벤치마크
2026-04-15-fe-developer-ai-dsl-assistantFE 개발자의 AI 활용 사례와 DSL Assistant 논문을 연결한 보존 메모
2026-04-15-anthropic-opus-4-7-ai-design-toolAnthropic이 Opus 4.7과 함께 프롬프트 기반 디자인 툴까지 위로 확장하려는 신호
2026-04-16-claude-opus-4-7-releaseOpus 4.7 정식 출시 — 코딩·장기 작업·비전 향상과 새 사이버 가드레일을 함께 발표
2026-04-26-openai-monitorability-evalsOpenAI가 CoT monitorability를 안전 평가 인프라로 공개한 데이터셋/코드 묶음
2026-07-17-openai-gpt-redGPT-Red를 활용한 자동화 레드팀과 프롬프트 인젝션 방어 훈련
2026-04-15-gemini-3-1-flash-tts자연어 지시와 오디오 태그로 스타일을 제어하는 Google의 최신 TTS 모델
2026-04-16-openai-oauth-chatgpt-account-openai-apiChatGPT/Codex OAuth 캐시를 OpenAI 호환 localhost 프록시로 재노출하는 비공식 프로젝트
2026-04-16-chatgpt-for-excelOpenAI가 Excel 리본 안으로 들어가 자연어 기반 시트 생성·분석·수정을 제공하는 공식 애드인
2026-04-16-ai-error-analysis-automationSentry→n8n→Gemini→Notion으로 에러 triage를 자동화하는 운영 패턴
2026-04-16-ai-fails-without-judgment테스트와 자동화가 늘어도 구조 판단은 인간이 맡아야 한다는 실무 에세이
2026-04-16-cal-com-closed-source-securityCal.com이 AI 기반 취약점 탐지를 이유로 프로덕션 제품을 닫고 Cal.diy만 MIT로 남긴 전환 사례
2026-04-16-stanford-ai-index-2026Stanford AI Index 2026 — 성능 가속, 미중 격차 축소, 안전·노동·환경 비용을 함께 읽는 연간 상태 보고서
2026-04-16-pi-autoresearch-geeknewsKarpathy식 autoresearch를 테스트·빌드·Lighthouse까지 확장한 범용 자율 실험 루프 정리
2026-04-20-kimi-k2-6Kimi K2.6 — 장기 실행 코딩, Agent Swarm, 툴 호출 안정성을 강화한 Moonshot AI의 오픈소스 모델
2026-04-25-ai-model-category-picks2026-04-25 기준 카테고리별 최고의 AI를 실사용 축으로 정리한 메모
2026-04-20-kimi-k2-6-vs-qwen3-6-vs-opus-4-7Kimi K2.6, Qwen3.6, Opus 4.7을 실무 선택 기준으로 비교한 코딩 에이전트 모델 가이드
2026-06-14-artificial-analysis-deepswe-coding-agent-indexCoding Agent Index 개편 — SWE-Bench Pro→DeepSWE 교체로 순위 재정렬, Fable 5 1위 데뷔
2026-07-12-artificial-analysis-intelligence-indexArtificial Analysis Intelligence Index v4.1 — 9개 평가 종합, 상위 50개 모델 점수 스냅샷 (1위 Fable 5 60점)
2026-07-12-hada-31342-gpt-5-6-model-app-build-off12개 LLM의 동일 앱 생성 비교 — GPT-5.6 Sol·Claude Fable 5·Grok 4.5
glm-5.2GLM-5.2 — Z.ai coding-first 1M 컨텍스트 모델 (2026-06-13, 벤치 미공개)
kimi-k2-7-codeKimi K2.7 Code — Moonshot 코딩 특화 1T MoE 오픈웨이트 (2026-06-12)
claude-fable-5Claude Fable 5 — Anthropic 최강 코딩 모델 (2026-06-09), 미 정부 지시로 접근 중단
2026-07-18-linkedin-sujin-claude-values-models-languagesClaude의 모델·언어별 가치 표현 차이 — 따뜻함·엄밀함·깊이·솔직함 네 축과 한국어 응답 해석
2026-06-14-new-coding-models-glm-kimi-fable-opus-gpt신규 코딩 모델 6종 비교 — GLM-5.2·Kimi K2.7 Code vs Fable 5·Opus 4.8·GPT-5.5
2026-06-26-glm52-mac-studio-dgx-spark-benchmarkMac Studio 512GB와 DGX Spark에서 GLM-5.2 MLX/GGUF 양자화 조합을 실행한 로컬 벤치마크
2026-07-12-justvugg-colibriGLM-5.2 744B MoE를 25GB RAM 소비자 기기에서 디스크 스트리밍으로 실행하는 순수 C 엔진
2026-07-17-chinese-open-model-download-share허깅페이스·OpenRouter·Vercel 집계로 본 중국계 오픈웨이트 모델 사용 확대
2026-07-17-pytorchkr-local-llm-gpu-hardware-guideRTX PRO 6000 4장과 PCIe P2P를 활용한 대규모 로컬 LLM 추론 장비 구성 사례
2026-07-18-pytorchkr-topic-11283-inkling-975b-moeInkling — 975B 멀티모달 MoE 오픈 웨이트 모델, 사고 노력 조절과 커스터마이징 중심
kimi-k3Kimi K3 — Moonshot 2.8T 오픈웨이트 MoE, 1M 컨텍스트·네이티브 비전·KDA 어텐션 (2026-07-16)

2026-04-24 ~ 04-28 신규

노트설명
2026-04-24-openrouter-model-pricing-comparisonOpenRouter 최근 출시 모델들의 API 가격·컨텍스트 윈도우 비교표
2026-06-26-openrouter-list-benchmarks-api-referenceOpenRouter GET /api/v1/benchmarks — Artificial Analysis·Design Arena 통합 벤치마크 API reference
2026-05-08-omniroute무료 AI gateway, 160+ providers, 13 routing strategies
2026-04-24-cloudflare-unweight-lossless-llm-compressionexponent Huffman coding으로 LLM 크기 22% 감소 — batch 1 처리량 41% 오버헤드
2026-04-24-threads-choi-openai-deepseek-v4-openweightsDeepSeek-V4 오픈웨이트 발표 — 100만 토큰·Think Max 주장, 검증 필요
2026-04-25-ai-model-category-picks2026-04-25 기준 카테고리별 최고 AI 모델 셀렉션
2026-04-26-nemotron-personas-korea국내 최초 대규모 한국어 페르소나 데이터셋 (700만 페르소나, 17억 토큰)
2026-04-27-mac-96gb-llm-recommendationMac 96GB+ Local LLM — Qwen3.6-27B보다 DeepSeek V4 Flash MLX·Minimax M2.7 우위
2026-04-26-swiftlm-apple-silicon-inferenceApple Silicon 네이티브 MLX 추론 서버, SSD Streaming + TurboQuant
2026-04-26-openai-monitorability-evalsOpenAI CoT 모니터링 기반 안전 평가 데이터셋/코드 공개
2026-04-26-local-llm-formats-comparisonMLX vs GGUF vs nvfp — 로컬 LLM 포맷별 용도·장단점 비교
2026-05-12-rapid-mlx-apple-silicon-local-ai-engineRapid-MLX — Apple Silicon 전용 초고속 로컬 AI 엔진
2026-05-19-whichllmwhichllm — 하드웨어 기반 로컬 LLM 추천 CLI
2026-05-12-llama-cpp-ollama-lmstudio-rapid-mlx-comparisonllama.cpp / Ollama / LM Studio / Rapid-MLX 비교 노트
2026-05-28-xiaomi-mimo-v2-5-price-cut-99-percentXiaomi MiMo-V2.5 API 최대 99% 영구 인하 — 딥시크 겨냥 가격 경쟁

인프라 & 도구

노트설명
2026-03-21-qmdQMD - Query Markup Documents (온디바이스 검색 엔진)

2026-07-18 신규 유입 (고아 정리)

노트설명
2026-03-29-llm-ensemble-voting-research연구 결과에 따르면, 여러 Large Language Model (LLM)의 출력을 voting 방식으로 결합하는 ensemble 방식은 단일 모델보다 정확도, 견고성, 신뢰성을 유의미하게 향상시킵니다.
2026-04-13-ai-expert-sources1. Anthropic 공식 블로그/유튜브 — Claude, 에이전트, 안전성 관련 최신 연구 2. 유튜브 ‘AI Engineer’ 채널 — AI 엔지니어링 실무 심층 콘텐츠 3. Lenny’s Podcast — 제품/성장 관점의 AI 인사이트 4. How I AI with Claire Vo — AI 실전 활용 인터뷰…
2026-04-19-openmythos-recurrent-depth-transformerClaude Mythos는 수백 개의 고유한 레이어를 쌓는 대신, 일부 레이어를 재활용하여 순간 전파(foreward pass) 동안 여러 번 실행하는 Looped Transformer일 가능성이 있다.
2026-04-19-supergemma4-e4b-abliterated무검열(abliterated) 처리 후 성능 저하를 복구해 4~16GB VRAM에서도 구동 가능하다고 소개된 경량 로컬 LLM 모델 SuperGemma4-E4B 요약.
2026-05-02-anthropic-knowledge-distilation-student-modelsAnthropic이 방금 전 세계 모든 AI 기업을 공포에 빠뜨렸습니다.
2026-05-06-dflash-gemma4-6x-fasterGemma 4는 가장 최적화된 무료 오픈소스 로컬 AI로 알려져 있으며, 오래된 노트북과 스마트폰에서도 동작한다.
2026-05-06-glm51-uncensored-security-test검열이 해제된 GLM-5.1 모델을 격리된 샌드박스 환경에서 실행하며, 모델이 자체 프로그램에 대해 보안 공격을 수행할 수 있는지 테스트했다.
2026-07-03-pytorchkr-topic-11058-tabfm-zero-shot-tabular-foundation-modelGoogle Research가 공개한 TabFM(Tabular Foundation Model)은 표 형식 데이터의 분류와 회귀를 별도의 학습이나 하이퍼파라미터 탐색 없이 단 한 번의 순전파로 처리하는 제로샷 파운데이션 모델이다.
2026-07-03-pytorchkr-topic-11065-anthropic-claude-fable-5-free-usage-promotionAnthropic의 최상위 모델 Claude Fable 5가 미국 수출통제 조치 해제(6/30)로 7월 1일 전 세계에 재배포되었습니다.
2026-07-05-all-rl-algorithms-from-scratchAll RL Algorithms from Scratch는 강화학습(RL) 알고리즘 18가지를 파이썬으로 직접 구현한 교육용 GitHub 저장소다.
2026-07-07-pytorchkr-topic-11090-skillcomposer-llm-agent-skill-composition-research스킬 라이브러리가 커질수록 ‘어떤 스킬을, 몇 개나, 어떤 순서로 쓸지’를 정하는 조합 선택이 추론 병목이 되고 있다.
2026-07-08-pytorchkr-topic-11121-xybrid-on-device-llm-voice-ai-runtimeXybrid는 LLM, 음성 인식(ASR), 음성 합성(TTS)을 클라우드 서버가 아니라 사용자 기기에서 직접 실행하기 위한 크로스플랫폼 런타임이다.
2026-07-08-pytorchkr-topic-11147-tencent-hy3-295b-open-source-moe-modelTencent Hy3는 텐센트 훈위안(Tencent Hy, 구 Hunyuan) 팀이 공개한 Apache 2.0 라이선스의 오픈소스 대규모 언어 모델이다.
2026-07-09-pytorchkr-topic-11161-deepteam-llm-agent-red-teaming-frameworkDeepTeam은 LLM 애플리케이션과 AI 에이전트를 대상으로 탈옥, 프롬프트 주입, 멀티턴 공격 등을 시뮬레이션하는 오픈소스 레드팀 프레임워크다.
2026-07-10-pytorchkr-soma-unified-body-layerSOMA는 NVIDIA DAIR Lab이 제안한 통합 바디 레이어로, SMPL·SMPL-X·MHR·Anny·GarmentMeasurements 등 서로 다른 인체 파라메트릭 모델을 하나의 표준 메시와 77관절 리그로 연결한다.
2026-07-10-pytorchkr-topic-11183-jobs-ai-exposure-us-job-market-visualizerAndrej Karpathy가 공개한 jobs는 미국 노동통계국(BLS)의 Occupational Outlook Handbook이 다루는 342개 직업을 인터랙티브 트리맵으로 탐색하는 개발·연구 도구다.
2026-07-12-pytorchkr-topic-11217-ai-2040-plan-a초지능 경쟁을 2040년까지 늦추고 연구 투명성·검증·컴퓨트 상호억제를 도입하자는 정책 권고 시나리오.
2026-07-13-pytorchkr-topic-11208-talk-normal-llmtalk-normal: 어떤 LLM이든 장황한 답변을 간결하게 만드는 시스템 프롬프트
2026-07-14-pytorchkr-topic-11221-colibri-744b-moePyTorchKR에서 소개한 colibri-744b-moe 관련 자료를 정리한 요약 노트.
2026-07-14-pytorchkr-topic-11235-lotus-llmLOTUS: 데이터에 LLM과 에이전트 처리를 대규모로 적용하는 시맨틱 연산자 프레임워크
2026-07-15-pytorchkr-topic-11250-sensorfm-health-foundation-modelPyTorchKR에서 소개한 sensorfm-health-foundation-model 관련 자료를 정리한 요약 노트.
2026-07-16-bonsai-27b-low-bit-on-device-llmBonsai 27B는 Qwen3.6-27B를 이진·삼진 가중치로 변환해 노트북과 스마트폰에서 실행하려는 PrismML의 저비트 LLM 연구다.
2026-07-17-inkling-open-weights-modelThinking Machines의 오픈웨이트 모델 Inkling은 최고 성능보다 토큰 효율·멀티모달 처리·파인튜닝 가능성을 앞세운다.
2026-07-18-claude-fable-5-system-prompt비공식적으로 추출된 Claude Fable 5 제품 시스템 프롬프트의 메모리·안전·행동 설계에 관한 AI Sparkup 요약.

2026-07-20 신규 유입 (고아 정리)

노트설명
2026-07-12-artificial-analysis-gpt-5-6-intelligence-vs-costArtificial Analysis의 Intelligence vs Cost 차트에서 GPT-5.6 Sol·Luna가 모든 추론 강도 구간에서 Terra를 파레토 우위로 앞선다는 트윗 요약.
2026-07-12-sebastian-raschka-grok-4-5-pareto-frontierSebastian Raschka가 Grok 4.5와 Meta Muse Spark 1.1을 추가한 지능-비용 비교 차트를 공개, Grok 4.5의 가성비를 지목.
2026-07-19-aisparkup-post-14555-27b-ai-prismml27B급 AI 모델이 아이폰에 들어갔다 — PrismML의 압축 방식.
2026-07-20-ai-frontier-ep104-gpt5-6-icmlGPT-5.6 Sol 공개와 ICML 2026 서울 현장 정리 — RSI 신호, AGI-pilled 학회, inference·칩·데이터·월드모델 생태계, 온프레미스 전환 전망.
2026-07-20-aisparkup-post-14587-ai-3-1밀라노 비코카대 연구 — AI 조언 접근이 가능해지자 ‘모른다’ 응답이 44%→3%로 줄고 정확도는 27%→9%로 떨어졌는데 확신도는 30%→76%로 뛴 실험 결과.
2026-07-20-pytorchkr-topic-11308-nvidia-rteb-1-nemotron-3-embed-feat-ragNVIDIA, RTEB 1위 오픈 임베딩 모델 Nemotron 3 Embed 공개 (feat. RAG, 에이전트 검색).
2026-07-20-pytorchkr-topic-11311-diffusion-llm-llada-diffusiongemma확산 언어 모델(Diffusion LLM)의 개념과 동작에 대한 연구 정리 — LLaDA에서 DiffusionGemma까지.
2026-07-20-pytorchkr-topic-11323-pike-rag-microsoft-ragPIKE-RAG — 전문 지식과 추론으로 정확도를 높인 Microsoft의 산업용 RAG 프레임워크.
2026-07-20-pytorchkr-topic-11328-2026-07-13-19-ai-mlPyTorchKR이 7/13~19일에 소개한 이번 주 AI/ML 논문 모음.

2026-07-20 신규 유입 (고아 정리, 3차)

노트설명
2026-05-02-gpt-5-5-claude-opus-4-7-opposite-prompt-adviceOpenAI와 Anthropic이 같은 날 낸 프롬프트 엔지니어링 가이드가 서로 반대 조언을 담고 있어 개발자들이 혼란을 겪었다는 X 스레드.
2026-06-30-unlimited-ocr-fixed-kv-cache-long-document-baidu바이두 Unlimited OCR — Reference Sliding Window Attention으로 디코더 KV 캐시를 상수로 묶어 40페이지 이상 문서를 한 번에 OCR.

관련 MOC