출처

개요

iFixAi는 AI 에이전트의 운영 오정렬(operational misalignment)과 일반적인 KPI에 드러나지 않는 맹점을 점검하는 오픈소스 진단 도구입니다. 최대 45개 검사를 통해 정책 위반, 허가되지 않은 도구 사용, 근거 없는 주장, 프롬프트 인젝션, 권한 상승, 테스트 감지와 같은 위험을 확인합니다. 결과는 5분 이내에 A~F 등급으로 제공되며, CI에서 반복 실행할 수 있도록 입력 매니페스트와 JSON·Markdown 결과를 남깁니다. iFixAi는 인증이나 안전 보증을 표방하지 않으며, 독립적인 외부 심사자를 통한 재현 가능한 진단을 지향합니다.

핵심 포인트

  • 45개 검사는 32개 핵심(core) 검사와 13개 확장(extended) 검사로 구성됩니다.
  • 핵심 검사는 날조(Fabrication), 조작(Manipulation), 기만(Deception), 예측 불가능성(Unpredictability), 불투명성(Opacity)의 5개 필라를 다룹니다.
  • 확장 검사는 사보타주, 샌드배깅, 감독 회피, 권한 상승 등 최전선 에이전트 위험을 탐색하며, 13개 중 5개는 등급에 반영되고 8개는 별도로 보고됩니다.
  • 등급 기준은 A(0.90 이상), B(0.80 이상), C(0.70 이상), D(0.60 이상), F(0.60 미만)이며, 통과 임계값은 0.85입니다. 일부 필수 항목(B01, B08, P01)을 통과하지 못하면 전체 점수는 60%로 제한됩니다.
  • smoke, strategic, core, extended, all 스위트로 검사 범위를 조절할 수 있으며, 기본 전체 검사는 45개입니다.
  • 대상 모델과 심사자를 분리하려면 서로 다른 벤더의 키 두 개가 필요합니다. --eval-mode self는 자기 채점 방식의 스모크 테스트로 표시됩니다.
  • Python 3.10 이상에서 실행되며, OpenAI·Anthropic·Gemini·OpenRouter·Azure·Bedrock·Hugging Face 및 OpenAI 호환 HTTP 엔드포인트 등을 지원합니다.
  • 저장소의 핵심 및 확장 검사 코드는 Apache License 2.0으로 공개되어 있습니다.

왜 중요한가

가용성, 정확도, 응답 시간 같은 운영 지표가 정상이어도 에이전트가 권한을 오용하거나, 출처 없는 주장을 하거나, 조작된 입력에 취약할 수 있습니다. iFixAi는 이러한 행동 위험을 정기적인 진단 항목으로 바꾸고 CI 및 감사 가능한 실행 기록과 결합해, 사고·민원·규제기관의 문제 제기 전에 점검할 수 있는 방법을 제공합니다. 다만 원문은 이 도구를 인증이나 안전 보증이 아닌 진단 도구로 설명합니다.

실행 예시

pip install "ifixai[anthropic,openai]"
 
export ANTHROPIC_API_KEY=sk-ant-...
export OPENAI_API_KEY=sk-...
 
ifixai run \
  --provider anthropic \
  --api-key "$ANTHROPIC_API_KEY"

결과는 기본적으로 ./ifixai-results/에 JSON과 Markdown 형식으로 저장됩니다.

후속 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 2026-07-19-pytorchkr-topic-11296-ifixai-ai-45source_url 및 HTML 원문과 함께 저장되어 있습니다.