Microsoft가 라우팅, 분류, 검증, 에이전트 제어에 쓰는 의사결정(decision) 모델 Microsoft-Decision-1을 내놓았다.[1][2] 이 모델은 문장을 생성하지 않고, 미리 정한 선택지마다 보정된(calibrated) 확률을 한 번의 호출로 계산해 JSON으로 돌려준다.[1][2] Microsoft는 이를 새로운 AI 범주인 결정 모델로 규정하며, 소프트웨어가 바로 실행할 수 있는 출력을 목표로 한다고 밝혔다.[1]
Kathryn Conrad & Rose Willis / Better Images of AI · CC BY 4.0 · 원본 · 크기 조정
공개일은 10월 9일(현지시간)이며, 공개 직후 Microsoft Foundry(정식 출시, 'Direct from Azure' 모델)와 Azure를 거치는 OpenRouter에서 이용할 수 있다.[2][1] 요금은 입력 100만 토큰당 $0.042이고 출력은 무료다. OpenAI의 Luna decisions 엔드포인트는 입력 100만 토큰당 $0.10, 출력 무료다.[1][2] 호스팅 API로만 제공되며 공개 가중치나 양자화 버전은 없고 구동 하드웨어도 공개되지 않았다.[1][2]
작동 방식과 쓰임새
지원하는 질문 형식은 예/아니요, 객관식, 등급(rating), 분류, 평가기준표(rubric)다. AI 응답이나 에이전트가 제안한 행동을 채점하고, 제공된 근거에 비춰 답이 근거에 충실한지(groundedness) 점검할 수 있다. '판단 불가' 같은 기권 선택지도 둘 수 있다.[1][2] 모델 선택, 요청 분류, 작업 우선순위 지정, 결과 검증, 에이전트 제어가 활용 예로 소개됐다.[2]
Microsoft는 보정 확률을 쓰면 확신이 높을 때는 자동 처리하고, 애매할 때는 사람 검토를 요청하거나 재시도·우회하는 제어 레이어를 만들 수 있다고 설명했다.[2]
기반은 Alibaba의 Qwen3.5-9B를 후속 학습한 모델이며, 정확한 매개변수 수는 공개되지 않았다.[1][2] 학습 데이터는 Microsoft Open Data 절차를 거친 공개 데이터셋과 합성 데이터다.[1] 이후 버전은 MAI와 OpenAI 모델을 기반으로 확장·재구축(rebase)할 계획이다.[1][2] 컨텍스트 창은 32,768 토큰이며 텍스트만 처리한다.[1][2]
OpenRouter에서는 chat 엔드포인트가 아니라 Decisions API로 동작해 Chat completions SDK를 쓸 수 없다. 가중치는 계속 갱신되지만 API 형태는 고정된다.[1]
OpenAI Decisions API와의 관계
OpenAI는 Decisions API를 지난달 개발자 행사에서 제한적 프리뷰로 공개한 뒤, 10월 6~7일 사이 공개 베타를 발표했다. Microsoft는 이보다 뒤인 10월 9일에 Decision-1을 공개했다.[2][3] OpenAI는 이 API가 산문 대신 정해진 선택지·확률·점수만 반환하며, Responses API(GPT-6 Luna 경유)보다 최대 약 10배 빠르다고 주장했다.[2]
성능 수치와 비교
Microsoft는 9개 시스템을 36개 벤치마크의 질문 147,137개로 비교했다. 벤치마크는 학습에서 제외했다.[1][2] 아래는 Microsoft가 만든 차트의 수치다.[1]
| 모델 | 평균 정확도 | 보정 점수 | 중앙 지연(차트) |
|---|---|---|---|
| Microsoft-Decision-1 | 83.5% | 92.2 | 85ms(p50) |
| Quyet-1.0-Large | 81.9% | 93.1 | 380ms |
| GPT-6 Luna Decisions | 79.4% | 89.9 | 300ms |
| H2O-Lightning-4B | 77.2% | 91.8 | 210ms |
정확도는 1위지만 보정 점수는 Quyet-1.0-Large에 이은 2위다.[1] 지연 시간은 p50 85ms, p95 125ms로, Microsoft는 Quyet-1.0-Large보다 4.5배, GPT-6 Sol(3.01초)보다 최대 35배 빠르다고 밝혔다.[1][2]
강건성 시험에서는 바꿔쓰기, 선택지 섞기 등 8가지 방식으로 요청을 변형했을 때 판단이 뒤집힌 비율이 평균 1.3%였다. 선택지 바꿔쓰기·뒤집기·섞기에서는 번복이 없었다.[1][2] 안전성은 유해 콘텐츠, 탈옥, 프롬프트 인젝션을 다룬 11개 벤치마크의 5,250개 요청으로 시험했고, Microsoft는 올바른 거부와 높은 유용성이 유지됐다고 보고했으나 점수는 공개하지 않았다.[1][2]
Microsoft가 밝힌 내부 사례는 다음과 같다.[1][2]
- Xbox Research: 설문, Steam, X 등의 사용자 의견 1만 건 이상을 주제별로 분류했다. GPT-6 Sol보다 14배 이상 빠르고 비용은 200분의 1이며, 품질은 비슷한 수준이라고 한다.[1][2]
- Copilot 응답 품질 평가: GPT-5.6 Luna와 경쟁할 만한 품질에 100배 빠르다고 한다.[1][2]
- Microsoft Discovery(과학 실험 계획 조정): LLM 기반 평가보다 일관성 46배, 속도 3배라고 한다.[1][2]
- 긴급 장애 대응 지식 검색: 기존 LLM보다 빠르고 성능이 우수하다고 Microsoft가 주장했으며 수치는 없다.[2]
한계와 논란
위 차트 수치는 Microsoft가 제시한 것이며, Microsoft-Decision-1은 JevBench 순위표에 오르지 않았고 JevBench의 독립 결과는 아직 나오지 않았다. 가중치도 공개되지 않았다.[1] 지연 시간 비교 방식도 논란이다. Microsoft는 Foundry에서 자사 모델을 직접 쟀지만, 경쟁 모델은 JevBench v1.6.1의 보정 중앙값을 썼다.[1] H2O.ai는 모델 카드에서 이 보정값이 측정 시간을 2배로 늘리고 0.15초를 더한 값이라고 지적하며, H2O-Lightning-4B의 실측 중앙값은 29ms로 Microsoft 차트의 210ms와 다르다고 주장했다. 또 그 순위표 종합 1위는 H2O-Lightning-4B(72.5)다.[1]
경쟁 모델은 사양이 다르다. Quyet-1.0-Large는 Chinh Nguyen이 Gemma-4-31B-it에 LoRA를 병합한 31.3B 텍스트 모델로 Apache-2.0이며 80GB GPU 1장에서 bf16으로 돌아간다. H2O-Lightning-4B는 H2O.ai가 Qwen3.5-4B로 만든 4B 텍스트·이미지 모델로 Apache-2.0이고, 32GB GPU에서 테스트했으며 가중치는 9.1GB다. GPT-6 Luna Decisions는 OpenAI의 비공개 독점 API로 텍스트와 이미지를 받는다.[1]
모델 카드에 적힌 한계는 이렇다. 텍스트 생성, 개방형 Q&A, 채팅, 번역, 요약 용도가 아니고, 이미지·오디오·영상은 처리하지 못하며, 설명이나 근거도 출력하지 않는다.[1] 신용·고용·주거·의료·법적 권리에 관한 결정을 이 모델 단독의 자동 판단에 맡기는 것은 금지된다. 애플리케이션이 선택지, 임계값, 에스컬레이션 경로, 사람 감독을 직접 정의해야 한다.[1]
각주·출처 3개
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26 ↩27 ↩28 ↩29 Microsoft AI Releases Microsoft-Decision-1: A Qwen3.5-9B Decision-Scoring Model · 확인 2026-10-10
- ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 MS, 에이전트 의사결정 특화 모델 ‘디시전-1’ 공개…오픈AI도 API 정식 출시 · 확인 2026-10-10
- ↩1 Microsoft launches its new AI model for making decisions quickly. · 확인 2026-10-10