Nace AI가 에이전트와 백엔드 워크플로용 의사결정 모델 Drex 1.5를 오픈소스로 공개했다. 이 모델은 글을 생성하지 않는다. 상태와 유형이 정해진 질문을 입력받아 각 선택지의 확률을 돌려준다. 파라미터는 약 89.5억 개(dense)다.[1]
Hanna Barakat & Cambridge Diversity Fund / Better Images of AI · CC BY 4.0 · 원본 · 크기 조정
Nace는 공개 Decision Index 0.3.1에서 58.08점을 받아 10B 미만 모델 가운데 최고 점수라고 밝혔다.[1]
가중치는 Hugging Face에 올라 있고, 호스팅 버전은 OpenRouter에서 쓸 수 있다. OpenRouter 요금은 입력 100만 토큰당 0.04달러, 출력 0달러이며 DeepInfra가 서빙한다. Nace는 자체 Console API도 운영하고, 클라우드 가입자에게 25달러 보너스를 제공한다.[1]
작동 방식
사용자는 텍스트나 JSON 형태의 상태와 이름 붙은 질문을 보낸다. 질문 유형은 선택형, 예/아니오형, 순서형 점수 3가지다. 질문마다 상태와 질문 전체를 한 번 통과시키는 방식으로 선택지를 채점하며, llama.cpp에서는 상태를 한 번만 인코딩해 여러 질문이 공유한다. 토큰을 샘플링하지 않으므로 샘플링 온도와 top_p는 적용되지 않으며, 모델은 사용자가 준 선택지 안에서만 답한다.[1]
기반은 Qwen 3.5 9B를 증류한 MiMo-V2.6-Distill-Qwen-9B다. 32개 층이며, 전체 어텐션 층 하나당 선형 어텐션 층 3개를 두는 하이브리드 구조다. 별도의 포인터 헤드(head.pt)가 은닉 상태에서 선택지별 점수를 매긴다. Nace의 Drex 페이지는 지표 벤치마크의 공식 학습 분할로 학습하고 보류 분할에서만 평가했다고 설명한다.[1]
API는 TypeSafe의 비공개 모델 Jev와 같은 POST /v1/systemone 형식이다. Nace는 기존 Jev 클라이언트가 환경 변수 몇 개만 바꾸면 동작한다고 밝혔다.[1]
성능
공개 Decision Index 0.3.1(37개 벤치마크, 우연 보정)에서 Drex 1.5는 58.08점이다. 모델 카드에 따르면 Jev 1.13.0은 57.96점, Bespoke Nimble 9B v3는 57.19점, Cloudflare clef-flash는 56.15점이다. 보드의 동률 구간(0.9점) 안에 있는 모델은 Drex 1.5, Jev 1.13.0, Bespoke Nimble 9B v3이며, Drex는 37개 중 20개에서 Jev를 앞선다. Drex 점수만 Nace가 공식 키트로 직접 실행한 결과이고, Jev와 Nimble 점수는 공개 리더보드를 인용한 것이다.[1]
| 항목 | Drex 1.5 | Jev 1.13.0 | Bespoke Nimble 9B v3 |
|---|---|---|---|
| 개발사 | Nace.AI | TypeSafe AI | Bespoke Labs |
| 가중치 | 공개 | 비공개(API만) | 공개(어댑터) |
| 라이선스 | Nace.AI Open RAIL-M | 상용 | CC BY-NC 4.0 |
| Decision Index 0.3.1 | 58.08 | 57.96 | 57.19 |
| Decision Index 0.2.1(Nace 런칭 차트의 구버전 지표) | 58.28 | 57.91 | 56.88(Nimble 자체 모델 카드 출처) |
| JevBench(231문항) | 86.2% | 87.0% | 미공개 |
| 입력/출력 100만 토큰당 가격 | $0.04 / $0 (OpenRouter) | $0.042 / $0 | 미공개 |
영역별로는 도구 사용(Tools)이 75.0점으로 가장 높고 지식·추론이 44.6점으로 가장 낮다. JevBench(공개 231문항)에서는 Drex가 86.2%, Jev가 87.0%로 Drex가 소폭 낮고, 어려운 문항 정확도는 두 모델 모두 73.9%다. OpenSpiel 게임 8종 맞대결에서는 Jev를 상대로 122승 47무 87패(56.8%)를 기록했다.[1]
긴 문서에서 강했다. 8K~32K 토큰 문서의 정확도는 89.5%(중앙 지연 0.65초), 32K~128K 토큰은 93.4%(2.0초)다. 같은 요청을 8K 토큰으로 자르면 8K~32K 구간은 76.5%, 32K~128K 구간은 78%로 떨어진다.[1]
실행 방법과 한계
bf16 가중치는 약 18GB이고 기본 컨텍스트는 16,384토큰, 최대 131,072토큰이다. CUDA GPU 한 장(24GB A10G에서 테스트)으로 돌릴 수 있고, 약 9.5GB의 Q8_0 GGUF는 Apple silicon과 CPU에서 돈다. 실행 경로는 4가지이며 모두 같은 API를 제공한다. Python 런타임(inference.py, serve.py)은 CUDA GPU용이고, llama.cpp Nace 포크는 bf16 또는 Q8_0 GGUF를 CUDA·Metal·CPU에서 구동한다. Ollama Nace 포크는 결정 기능을 추가했고, 나머지 하나는 호스팅이다. AWS g5.2xlarge에서 bf16과 Q8_0 답이 같았고, Q8_0은 Apple M5 Pro의 Metal·CPU에서도 일치했다.[1]
Drex 에이전트 스킬로 Claude Code, Codex, Cursor, OpenCode, Hermes Agent, Gemini CLI, GitHub Copilot에 연결할 수 있다.[1]
한계도 뚜렷하다. 텍스트·코드·설명은 만들지 못한다. GPQA Diamond는 45.4%로 Jev의 78.6%보다 낮고, MMLU-Pro는 58.7%로 Jev의 82.7%에 못 미친다. ACOS 속성 감성 분석의 리뷰당 F1은 7.4%로 Jev의 29.5%보다 낮다.[1]
지표 벤치마크의 학습 분할로 학습했으므로 익숙한 결정 유형에서 유리할 수 있고, 새 영역에서는 결과가 다를 수 있다. Ollama와 llama.cpp 로컬 배포에는 주류 빌드가 아닌 Nace 포크가 필요하다. 라이선스는 사용 제한이 있는 RAIL-M이라 상업 이용 전 약관 확인이 필요하다.[1]
분석: 점수가 동률 구간 안이라 Jev보다 낫다고 단정하기는 어렵다. 다만 가중치가 공개돼 GPU 한 장이나 Mac에서 비슷한 수준의 결정 계층을 직접 돌릴 수 있다. 여기에 Nace의 주장대로 환경 변수 몇 개만 바꿔 기존 Jev 클라이언트가 동작한다면 전환 부담이 작아, 이 점이 도입 판단의 핵심이 된다. 지식 집약 과제에는 맞지 않는다.[1]