首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
SGLang 部署 NeoHorse-1-4B 实战:3条命令拉起 OpenAI 兼容 API
📅 2026/9/25 4:03:51
✍️ 爱科研究院
👁 阅读 3,247
SGLang 部署 NeoHorse-1-4B 实战3条命令拉起 OpenAI 兼容 API【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B 是 TokenRhythm 基于 Qwen3.5-4B 后训练的 40 亿参数智能体语言模型专注工具调用、编码与指令遵循。本文演示如何用 SGLang 部署 NeoHorse-1-4B只需 3 条命令即可拉起 OpenAI 兼容 API让你快速把它接入自己的应用。为什么选 NeoHorse-1-4B 这个 4B 智能体模型NeoHorse-1-4B 的核心卖点是智能体后训练Agentic 能力在 QwenClawBench、WorkBuddy Bench、tau2-Bench 等智能体基准上全面领先tau2-Bench 得分 88.46超过 10B 级别的多个模型编码能力HumanEval 达到 96.95LiveCodeBench v6 达到 59.43指令遵循IFEval 88.35、IFBench 65.33复杂约束任务表现出色综合成绩十项基准宏平均 64.87比基座 Qwen3.5-4B58.94高出5.93此外它原生支持 262,144 token 上下文BF16 精度的 4B 规模对显存相对友好单机 GPU 即可承载适合个人和小团队自托管。模型权重格式为 Safetensors可通过 model.safetensors.index.json 查看分片索引。准备工作下载 NeoHorse-1-4B 模型权重部署前先把模型下载到本地目录。仓库地址git lfs install git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B下载完成后目录中应包含以下关键文件文件作用config.json模型结构配置model_type为qwen3_5_text最大位置编码 262144tokenizer.json / vocab.json分词器词表chat_template.jinja对话模板含思考模式thinking支持model-00001-of-00002.safetensors 等BF16 模型权重分片 提示config.json 中可见该模型采用线性注意力与全注意力混合的层结构full_attention_interval为 4这也是长上下文下推理效率较高的重要原因。命令一安装 SGLang 推理引擎官方技术报告使用的版本是 SGLang v0.5.17建议固定版本以保证行为一致pip install sglang0.5.17SGLang 是一个高性能大模型服务框架支持 RadixAttention 前缀缓存、连续批处理等优化天然提供 OpenAI 兼容接口。命令二一条命令启动 NeoHorse-1-4B 服务python3 -m sglang.launch_server \ --model-path /path/to/NeoHorse-1-4B \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder关键参数速览--served-model-name neohorse-1-4b对外暴露的模型名后续 API 请求中填写这个名字--context-length 262144启用完整的 262K 上下文若显存不足可适当调小--reasoning-parser qwen3解析思考模式输出enable_thinking--tool-call-parser qwen3_coder启用工具调用解析这是智能体场景的必备项服务启动后会暴露 OpenAI 兼容的/v1/chat/completions端点。命令三发送第一个 OpenAI 兼容请求curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:neohorse-1-4b,messages:[{role:user,content:Write a Python function that returns the first n Fibonacci numbers.}],max_tokens:512}看到返回的 JSON 流式内容说明 NeoHorse-1-4B 已经成功运行 。任何支持 OpenAI SDK 的框架LangChain、OpenAI Python SDK、各种 Agent 框架只需把base_url指向http://localhost:30000/v1即可无缝切换。常见问题与最佳实践Q1显存不够怎么办4B BF16 权重约 8GB加上 262K 上下文的 KV Cache 占用会更大。显存紧张时优先降低--context-length或改用--quantization量化加载。Q2如何启用思考模式NeoHorse-1-4B 支持 thinking 模式chat_template.jinja 中已内置相关模板逻辑。评测协议中使用的采样参数可供参考temperature1.0、top_p0.95、top_k20、presence_penalty1.5。Q3没有 GPU 或想用别的框架README 中同样提供了 vLLM 部署方式--max-model-len 262144配合相同的 reasoning/tool-call parser可参考 README.md 的 Deployment 章节。Q4商用许可是什么项目采用 Apache License 2.0 许可可自由商用详见 LICENSE。总结用 SGLang 部署 NeoHorse-1-4B 只需 3 步安装指定版本 → 启动服务 → 发送兼容请求。部署完成后你就拥有了一个具备工具调用、编码和长上下文能力的 4B 级智能体模型 API可以直接驱动 Agent 应用、代码助手或工具编排系统。更多基准数据与模型细节可查阅 README.md 与模型配置 config.json。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/25 4:03:51
STM32培训机构怎么选?老工程师拆解课程猫腻与避坑指南
2026/9/25 4:03:51
HDP发行版HBase二进制包部署指南:从解压到Sqoop导入验证
2026/9/25 4:03:51
嵌入式WASM开发:ESP32上硬件访问的边界与正确姿势
2026/9/25 4:38:53
ERROR #134 致命错误排查指南:从缓存清理到插件冲突的完整解决方案
2026/9/25 4:38:53
STM32实验室火灾预警系统设计:多传感器融合与三级状态机实现
2026/9/25 4:38:53
股市估值如何牵动海底资源开发
2026/9/25 4:38:53
Hyper-V显卡直通DDA完全指南:从零实现GPU性能无损
2026/9/25 4:38:53
九联UNT403A/UNT413A免拆刷机教程:晶晨S905L3芯片安卓9.0固件实战
2026/9/25 4:33:53
STC8G1K08A开发环境搭建:VSCode+Keil C51双剑合璧实战指南
2026/9/25 0:03:37
AI元人文:从工具使用到思维重构的深度探索
2026/9/25 0:03:37
Python+CNN车牌识别实战:从数据预处理到模型训练与部署
2026/9/25 0:03:37
Vim基础操作全攻略:保存退出、模式切换与高频命令实战
2026/9/23 19:31:10
深入解析Transformer多头注意力机制与工程优化
2026/9/23 19:31:10
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/23 19:31:09
ChatGPT报错Oops, an error occurred! 全链路排查指南