SC117's picture
Upload README_zh.md
4d2cf3d verified
|
Raw
History Blame Contribute Delete
18.4 kB
metadata
library_name: transformers
license: mit
license_link: https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B/blob/main/LICENSE
pipeline_tag: text-generation
tags:
  - qwen3_5
  - reasoning
  - agentic-coding
  - mtp
  - heretic
  - abliteration
  - safetensors
  - multimodal
base_model:
  - deepreinforce-ai/Ornith-1.0-9B
heretic MTP Vision MIT

Ornith-1.0-9B-heretic-MTP

English | 📖 中文文档

自我改进的 agentic coding 推理模型 · heretic ARA-LoRA 去审查化 · MTP 注入 · BF16 Safetensors

🐦 关于 Ornith

Ornith-1.0-9B 是由 DeepReinforce AI 开发的自我改进 agentic coding 推理模型,基于 Qwen3.5(9B Dense)进行后训练,通过强化学习同时优化脚手架生成和解决方案推演。

在 Terminal-Bench 2.1、SWE-Bench Verified、NL2Repo 和 OpenClaw 等基准测试中,在同等规模开源模型中表现优异。

本仓库包含 BF16 Safetensors 版本,使用 heretic ARA-LoRA 进行去审查化,从 Qwen3.5-9B 注入 MTP 层,并附带 mmproj-F16 视觉投影器。GGUF 量化版本请查看 SC117/Ornith-1.0-9B-heretic-MTP-GGUF许可证:MIT。

🧠 模型详情
架构Qwen3.5 Dense
参数量~9B(全部参数激活)
层数33 个 transformer 层 + 1 个 MTP 层
上下文长度262,144 tokens
注意力16 头,4 KV 头(GQA)
精度BF16
MTP1 个 MTP 层,从 Qwen3.5-9B 注入(同架构,兼容权重)
思考模式支持( 块)
许可证MIT
🔓 heretic ARA-LoRA 去审查化

本模型使用 heretic 的 ARA-LoRA 方法(Arbitrary-Rank Ablation with LoRA)进行去审查化。ARA-LoRA 通过在模型权重空间中识别和消除拒绝行为方向来实现去审查,同时通过 KL 散度控制保持通用能力。

关键消融参数(Trial 76/250,最佳结果):

目标层第 14–16 层
preserve_good_behavior_weight0.7319
steer_bad_behavior_weight0.0001
overcorrect_relative_weight1.1086
neighbor_count7
结果KL 散度:0.0288(< 0.05 ✅),拒绝率:3/100(< 10 ✅)

量化方式:bnb_4bit · 批大小:32 · 目标:KL < 0.05,拒绝率 < 10/100

MTP(多 Token 预测)

MTP 层从 Qwen3.5-9B 原始基础模型注入(同架构,兼容权重)。MTP 使模型能够同时预测多个未来 token,提高生成速度和连贯性。

MTP 层包含 mtp.fc.weightmtp.layers.0.* 张量,添加在 33 个标准 transformer 层之上。

在 llama.cpp 中需要 --chat-template chatml 以正确渲染思考模式。

📊 BenchLocal 测试成绩(Q6_K, 7.6 GB)
指标ToolCall-15BugFind-15HermesAgent-20上限实用
分数100947989.868.8

RTX 5070 Ti · 共 21 次重试 · ToolCall 满分 100/100 🏆

🚀 使用方法(Transformers)

安装依赖

pip install transformers torch accelerate

加载模型

from transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("SC117/Ornith-1.0-9B-heretic-MTP", torch_dtype="bfloat16", device_map="auto") tokenizer = AutoTokenizer.from_pretrained("SC117/Ornith-1.0-9B-heretic-MTP")

llama.cpp

# 先转换为 GGUF,然后: ./llama-server -m model-Q6_K.gguf --chat-template chatml -ngl 99 -c 8192

🎛️ 推荐参数
参数
temperature0.6
top_p0.95
top_k20

来自 DeepReinforce AI 官方模型卡片。

GGUF 量化版本

GGUF 量化版本(Q8_0、Q6_K、Q4_K_M)请查看:SC117/Ornith-1.0-9B-heretic-MTP-GGUF

文件列表

文件 说明
model-*.safetensors 模型权重(BF16,5 个分片)
config.json 模型配置
tokenizer.json 分词器
tokenizer_config.json 分词器配置
chat_template.jinja 思考模式聊天模板
model.safetensors.index.json 权重索引

链接

引用

@misc{ornith-9b,
    title = {{Ornith-1.0-9B}: Agentic Coding, Open to All},
    url = {https://deep-reinforce.com/ornith_1_0.html},
    author = {{DeepReinforce Team}},
    year = {2026}
}