首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
Ornith-1.5 对位 DeepSeek V4:‘叫板‘的底气到底有几分
📅 2026/10/9 19:21:57
✍️ 爱科研究院
👁 阅读 3,247
Ornith-1.5 对位 DeepSeek V4叫板的底气到底有几分【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF2026 年 8 月DeepReinforce 发布 Ornith-1.5 系列社区舆论瞬间被一个话题点燃Ornith-1.5 叫板 DeepSeek V4。这句话不是空穴来风——翻开官方基准表DeepSeek-V4-Flash-0731 (284B)赫然出现在对比栏里而且 Ornith 全线领先。但叫板二字在自媒体标题里是一句爽话在工程语境里却是一笔需要逐项核算的账对位的是 V4 全系还是 V4 Flash35B-A3B 这张小卡凭什么参与这场对局量化部署的成本账怎么算本文基于官方 benchmark 数据、社区一手实测与本仓库Ornith-1.5-35B-A3B-GGUF的实际文件把这场叫板拆开来看。一、叫板的出处官方表格里的正面交锋先看结论Ornith 确实主动把 DeepSeek V4 写进了自己的对比名单。在官方技术博客的完整评测表中Ornith-1.5-397B 与 DeepSeek-V4-Flash-0731总参数 284B在全部十六项编码、推理、智能体基准上逐项对位且无一落后核心数据如下基准Ornith-1.5-397BDeepSeek-V4-Flash-0731 (284B)差距Terminal-Bench 2.1 (Terminus-2)86.182.73.4SWE-bench Verified8681.64.4SWE-bench Pro65.164.40.7DeepSWE5654.41.6Frontier-Bench v0.113.56.17.4HLE (no tools)44.635.09.6HLE (with tools)56.150.85.3GPQA Diamond92.891.41.4MCP-Atlas8074.65.4BrowseComp86.684.81.8ClawEval81.477.63.8但这句叫板需要两个括号。其一对手是V4 Flash——DeepSeek 体系里的轻量档284B MoE并非 V4 全系最重的那档其二官方同时拉上了 Claude Opus 4.8 作为参照系Terminal-Bench 2.1 为 86.1 vs 85.0、SWE-bench Verified 为 86 vs 85.8Ornith 占优但在 DeepSWE 上 56 vs 59、Frontier-Bench 上 13.5 vs 21.1Ornith 仍落后于闭源旗舰。所以更严谨的表述是Ornith-1.5-397B 在开源阵营里把对位 DeepSeek V4 Flash这件事做实了但对闭源天花板还差半步。二、35B-A3B社区真正拿来对位的是谁自媒体标题把叫板的流量引到了 35B-A3B 上但翻开源仓库 README.md 的基准表会发现35B 规格的官方对照组里根本没有 DeepSeek V4——它的对手是 Qwen3.6-35B-A3B、Gemma-4-31B稠密、Muse-Glimmer-30B稠密以及作为跨级参照的 Qwen3.5-397B这张图说明了一个更戏剧性的事实每 token 只激活约 3B 参数的模型打穿了同体量的稠密模型甚至逼近并反超了 397B 级旗舰。看几个关键点编码全面压制同规格对手Terminal-Bench 2.1 (Terminus-2) 67.8而 Qwen3.6-35B-A3B 只有 52.5、Gemma-4-31B 只有 42.1SWE-bench Verified 79.0高于 Qwen3.6-35B-A3B 的 73.4也高于 Qwen3.5-397B 的 76.4。DeepSWE 上直接清零式碾压22 分对 Ornith-1.0 的 0、Qwen3.6 的 0、Qwen3.5-397B 的 1——这是官方表里最悬殊的一栏也最能体现自我改进循环在真实软件工程任务上的积累评估基于 Claude Code harness 与 256K 上下文窗口。但并非全胜HLE无工具25.6低于 Qwen3.5-397B 的 28.7BrowseComp 67.6 对 78.6、WideSearch 67.8 对 74说明在长程检索与纯推理上3B 大脑与 397B 仍有代差MCP-Atlas 上还落后于稠密的 Muse-Glimmer-30B75.5。所以社区那句叫板 DeepSeek V4但仔细看分数事情没那么简单并非标题党——35B 规格真正对位的不是 DeepSeek V4而是小显存能否扛起 agentic 工作负载这个命题这才是它引发实测热潮的根本原因。三、架构与部署成本12G 显存对服务器集群35B 总参数、每 token 仅激活约 3B是 Ornith-1.5-35B-A3B 的立身之本型号里的 A3B 即指激活量。社区博主给出的比喻很贴切35B 是编制3B 是现役上岗——专家网络平日闲置推理时按需路由这让它的部署成本断崖式低于同参数量的稠密模型更远低于 284B 的 DeepSeek V4 Flash。官方对 35B 规格的定位是明确的bf16 全精度约 70GB 权重README 给出的标准部署方案是2×80GB GPU起为 256K 上下文留出余量vllm serve ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --tensor-parallel-size 2 \ --max-model-len 262144 \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3而本仓库提供的 GGUF 量化阶梯把这条门槛进一步拉到了消费级硬件Ornith-1.5-35B-Q4_K_M.gguf 约 21.7GB、Ornith-1.5-35B-Q8_0.gguf、Ornith-1.5-35B-Q6_K.gguf、Ornith-1.5-35B-Q5_K_M.gguf 直到 Ornith-1.5-35B-BF16.gguf约 71GB的全谱系另附 mmproj-Ornith-1.5-35B-BF16.gguf 视觉投影权重为多模态输入留好通道。README 给出一条一行式启动命令llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144社区实测验证了这条路径的可行性一张4070Ti12G 显存 32G 内存用 llama.cpp 的 llama-server 加载 Q4_K_M核心三招——--n-cpu-moe 24把 24 个专家offload到内存、KV cache 量化到 q8_0--cache-type-k q8_0 --cache-type-v q8_0、照抄官方采样参数--temp 0.6 --top-p 0.95 --top-k 20——即可在170K 上下文下稳定跑到约 60 token/s日常改 bug、读代码、跑草稿完全够用。博主还提醒两个坑必须开--jinja否则 think 块会裸奔出模板和--reasoning on让思维链与正文分离返回。若需求超越 256KREADME 提供了 YaRN 静态扩展方案把rope_scalingrope_type: yarn、factor: 4.0写进 config.json 后窗口可拉至约 1M——但官方明确提示静态缩放会轻微损伤短输入质量属于不到万不得已别开的选项。对比之下DeepSeek V4 Flash 是 284B 量级的 MoE其部署面是服务器集群与云 APIOrnith-1.5-35B-A3B 的差异化叙事则非常清晰把 agentic 编码能力装进一张游戏卡。这也是抖音、CSDN 上小显存部署大模型的新答案这类标题批量出现的原因。四、开源生态话语权站上 Qwen 肩膀还是自成一体叫板最深的看点在训练范式。Ornith-1.0 本身就是基于 Qwen3.5 与 Gemma 4 做持续预训练CPT、中期训练与后训练而来——它选择了站在开源底座上再进化而非从零自研架构到了 Ornith-1.5自我改进循环被升级为完整闭环模型自己出题task generation、自己搭评测脚手架scaffold construction、自己生成解solution rollouts再用 GRPO 联合优化三阶段任务奖励被分解为有效性与可验证性 × 前沿难度 × 新颖度的乘积形式R_task V × D × N其中前沿难度以模型自身 rollout 的成功率逼近目标值 p*0.2 来衡量——模型越强旧任务自动贬值出题器被迫转向更难的新题。这与 DeepSeek 的自研路线独立架构 弹性算力基建构成了开源生态里两种截然相反的哲学一边是用海量真实代码库投喂静态分布一边是让模型在动态自生成的课程里持续推高自己的能力前沿。后者在 DeepSWE22 vs 0/1这类需要真实工程操作的基准上立竿见影也解释了为什么 Ornith 的每次发布都能引发一波自己给自己出题的讨论热。生态层面的实证同样密集发布当日知乎出现开源即王炸的实测长文CSDN 迅速跟进部署教程与 16G 显存横向测评抖音博主用跑起来像 3B、脑子接近 27B 稠密模型来定性而 GGUF 镜像仓库即本仓库第一时间铺开五档量化权重——量化链路的完善速度本身就是开源话语权的硬指标。与此同时README 中 Ollama、llama.cpp、Atomic.chat、Hermes、OpenClaw、OpenCode 等 agent 框架的开箱即用适配意味着它已经悄然进入本地 agent 工作流的标准候选名单。结语底气有几分账要分开算把三层证据叠起来叫板的成色可以这样结算分数账397B 对 DeepSeek V4 Flash 全项占优有官方数据背书但对标闭源 Opus 4.8 仍有 DeepSWE、Frontier-Bench 的短板且对手只是 Flash 档谈不上掀翻 V4。成本账35B-A3B 真正的底气是3B 激活 量化后 12G 显存可跑在 170K 上下文下维持 60 token/s——这是 284B 的 V4 Flash 给不了的消费级体验。范式账最值得关注的不是某一栏分数而是模型自我进化这条新路线正式从论文走入开源生态。当模型开始给自己出题、自己搭考场模型 vs 模型的对比终将升级为训练范式 vs 训练范式的对比——那时叫板 DeepSeek V4的叙事会显得相当次要。对开发者而言结论反而简单想在本地、在消费级显卡上跑一个能进终端干活、能拆任务、能调工具的 agentic 模型Ornith-1.5-35B-A3B 的 GGUF 量化版本是目前性价比最高的选项之一至于叫板谁让分数表去说话让 benchmark 条件去较真。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/9 19:21:57
TC3系列芯片I2C中断深度解析:汽车级可靠性设计与实战
2026/10/9 19:21:57
skillfile 1.6.4 Windows x64 下载:用清单和锁文件管理 AI Skills
2026/10/9 19:21:57
rgx 0.12.3 Windows x64 下载:在终端交互测试正则表达式
2026/10/9 22:08:23
从Cursor到GPT-5-Codex:AI编程Agent的技术与商业全解析——TaoToken统一Key/API通道实践
2026/10/9 22:08:23
GLiNER 实战踩坑实录:重叠实体、长文本、阈值调不好,抽出来的全是噪音
2026/10/9 22:08:23
Claude Code 与 Git 的完美协作流程:用 TaoToken 统一 Key 打通 commit 到 PR
2026/10/9 22:08:23
GitHub 日榜速报点名背后:tendedero 领衔的“小而美 macOS 工具“正在批量霸榜
2026/10/9 22:08:23
一个开源 App 怎么上了新浪财经头条?拆解 DiPlay “老油车翻身“的破圈路径
2026/10/9 22:03:22
大模型预训练、微调、强化学习、评估指导实践:用 TaoToken 统一 Key 打通四阶段实验流水线
2026/10/9 0:01:35
RISC-V裸机启动全流程:从复位向量到main函数的七步实现
2026/10/9 0:01:35
Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南
2026/10/9 0:01:35
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错
2026/10/8 5:02:14
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/9 1:10:43
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/9 3:31:49
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/8 4:30:43
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/9 3:32:01
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/9 11:36:17
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)