AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
기타 AI

Nace AI, 옵션별 확률 내는 9B 의사결정 모델 Drex 1.5 공개

Nace AI가 텍스트를 쓰지 않고 선택지마다 확률을 돌려주는 89.5억 파라미터 의사결정 모델 Drex 1.5의 가중치를 공개했다. 공개 지표 Decision Index 0.3.1에서 58.08점을 기록했다고 밝혔다.

Nace AI가 에이전트와 백엔드 워크플로용 의사결정 모델 Drex 1.5를 오픈소스로 공개했다. 이 모델은 글을 생성하지 않는다. 상태와 유형이 정해진 질문을 입력받아 각 선택지의 확률을 돌려준다. 파라미터는 약 89.5억 개(dense)다.[1]

오래된 삽화 스타일의 여성 얼굴 옆모습이 그려져 있고, 두상 안의 구역들이 번호와 라벨이 붙은 골상학 도표처럼 나뉘어 있다. 그 위로 신경망을 나타내는 연결선과 점들이 겹쳐 있다.
빈티지 두상 그림 위에 신경망 그물이 겹쳐진 콜라주
Hanna Barakat & Cambridge Diversity Fund / Better Images of AI · CC BY 4.0 · 원본 · 크기 조정

Nace는 공개 Decision Index 0.3.1에서 58.08점을 받아 10B 미만 모델 가운데 최고 점수라고 밝혔다.[1]

가중치는 Hugging Face에 올라 있고, 호스팅 버전은 OpenRouter에서 쓸 수 있다. OpenRouter 요금은 입력 100만 토큰당 0.04달러, 출력 0달러이며 DeepInfra가 서빙한다. Nace는 자체 Console API도 운영하고, 클라우드 가입자에게 25달러 보너스를 제공한다.[1]

작동 방식

사용자는 텍스트나 JSON 형태의 상태와 이름 붙은 질문을 보낸다. 질문 유형은 선택형, 예/아니오형, 순서형 점수 3가지다. 질문마다 상태와 질문 전체를 한 번 통과시키는 방식으로 선택지를 채점하며, llama.cpp에서는 상태를 한 번만 인코딩해 여러 질문이 공유한다. 토큰을 샘플링하지 않으므로 샘플링 온도와 top_p는 적용되지 않으며, 모델은 사용자가 준 선택지 안에서만 답한다.[1]

기반은 Qwen 3.5 9B를 증류한 MiMo-V2.6-Distill-Qwen-9B다. 32개 층이며, 전체 어텐션 층 하나당 선형 어텐션 층 3개를 두는 하이브리드 구조다. 별도의 포인터 헤드(head.pt)가 은닉 상태에서 선택지별 점수를 매긴다. Nace의 Drex 페이지는 지표 벤치마크의 공식 학습 분할로 학습하고 보류 분할에서만 평가했다고 설명한다.[1]

API는 TypeSafe의 비공개 모델 Jev와 같은 POST /v1/systemone 형식이다. Nace는 기존 Jev 클라이언트가 환경 변수 몇 개만 바꾸면 동작한다고 밝혔다.[1]

성능

공개 Decision Index 0.3.1(37개 벤치마크, 우연 보정)에서 Drex 1.5는 58.08점이다. 모델 카드에 따르면 Jev 1.13.0은 57.96점, Bespoke Nimble 9B v3는 57.19점, Cloudflare clef-flash는 56.15점이다. 보드의 동률 구간(0.9점) 안에 있는 모델은 Drex 1.5, Jev 1.13.0, Bespoke Nimble 9B v3이며, Drex는 37개 중 20개에서 Jev를 앞선다. Drex 점수만 Nace가 공식 키트로 직접 실행한 결과이고, Jev와 Nimble 점수는 공개 리더보드를 인용한 것이다.[1]

의사결정 모델 비교
항목Drex 1.5Jev 1.13.0Bespoke Nimble 9B v3
개발사Nace.AITypeSafe AIBespoke Labs
가중치공개비공개(API만)공개(어댑터)
라이선스Nace.AI Open RAIL-M상용CC BY-NC 4.0
Decision Index 0.3.158.0857.9657.19
Decision Index 0.2.1(Nace 런칭 차트의 구버전 지표)58.2857.9156.88(Nimble 자체 모델 카드 출처)
JevBench(231문항)86.2%87.0%미공개
입력/출력 100만 토큰당 가격$0.04 / $0 (OpenRouter)$0.042 / $0미공개
[1]

영역별로는 도구 사용(Tools)이 75.0점으로 가장 높고 지식·추론이 44.6점으로 가장 낮다. JevBench(공개 231문항)에서는 Drex가 86.2%, Jev가 87.0%로 Drex가 소폭 낮고, 어려운 문항 정확도는 두 모델 모두 73.9%다. OpenSpiel 게임 8종 맞대결에서는 Jev를 상대로 122승 47무 87패(56.8%)를 기록했다.[1]

긴 문서에서 강했다. 8K~32K 토큰 문서의 정확도는 89.5%(중앙 지연 0.65초), 32K~128K 토큰은 93.4%(2.0초)다. 같은 요청을 8K 토큰으로 자르면 8K~32K 구간은 76.5%, 32K~128K 구간은 78%로 떨어진다.[1]

실행 방법과 한계

bf16 가중치는 약 18GB이고 기본 컨텍스트는 16,384토큰, 최대 131,072토큰이다. CUDA GPU 한 장(24GB A10G에서 테스트)으로 돌릴 수 있고, 약 9.5GB의 Q8_0 GGUF는 Apple silicon과 CPU에서 돈다. 실행 경로는 4가지이며 모두 같은 API를 제공한다. Python 런타임(inference.py, serve.py)은 CUDA GPU용이고, llama.cpp Nace 포크는 bf16 또는 Q8_0 GGUF를 CUDA·Metal·CPU에서 구동한다. Ollama Nace 포크는 결정 기능을 추가했고, 나머지 하나는 호스팅이다. AWS g5.2xlarge에서 bf16과 Q8_0 답이 같았고, Q8_0은 Apple M5 Pro의 Metal·CPU에서도 일치했다.[1]

Drex 에이전트 스킬로 Claude Code, Codex, Cursor, OpenCode, Hermes Agent, Gemini CLI, GitHub Copilot에 연결할 수 있다.[1]

한계도 뚜렷하다. 텍스트·코드·설명은 만들지 못한다. GPQA Diamond는 45.4%로 Jev의 78.6%보다 낮고, MMLU-Pro는 58.7%로 Jev의 82.7%에 못 미친다. ACOS 속성 감성 분석의 리뷰당 F1은 7.4%로 Jev의 29.5%보다 낮다.[1]

지표 벤치마크의 학습 분할로 학습했으므로 익숙한 결정 유형에서 유리할 수 있고, 새 영역에서는 결과가 다를 수 있다. Ollama와 llama.cpp 로컬 배포에는 주류 빌드가 아닌 Nace 포크가 필요하다. 라이선스는 사용 제한이 있는 RAIL-M이라 상업 이용 전 약관 확인이 필요하다.[1]

분석: 점수가 동률 구간 안이라 Jev보다 낫다고 단정하기는 어렵다. 다만 가중치가 공개돼 GPU 한 장이나 Mac에서 비슷한 수준의 결정 계층을 직접 돌릴 수 있다. 여기에 Nace의 주장대로 환경 변수 몇 개만 바꿔 기존 Jev 클라이언트가 동작한다면 전환 부담이 작아, 이 점이 도입 판단의 핵심이 된다. 지식 집약 과제에는 맞지 않는다.[1]

각주·출처 1개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 Nace AI Open-Sources Drex 1.5: A 9B Decision Model That Scores Options, Not Text · 확인 2026-10-10
조회 —

독자의 생각

직접 써 본 경험과 다른 관점을 나눠 주세요. 주장에는 근거를, 서로에게는 존중을 부탁드립니다.

독자 의견을 불러오고 있습니다.