SGLang 部署 NeoHorse-1-4B 实战3条命令拉起 OpenAI 兼容 API【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B 是 TokenRhythm 基于 Qwen3.5-4B 后训练的 40 亿参数智能体语言模型专注工具调用、编码与指令遵循。本文演示如何用 SGLang 部署 NeoHorse-1-4B只需 3 条命令即可拉起 OpenAI 兼容 API让你快速把它接入自己的应用。为什么选 NeoHorse-1-4B 这个 4B 智能体模型NeoHorse-1-4B 的核心卖点是智能体后训练Agentic 能力在 QwenClawBench、WorkBuddy Bench、tau2-Bench 等智能体基准上全面领先tau2-Bench 得分 88.46超过 10B 级别的多个模型编码能力HumanEval 达到 96.95LiveCodeBench v6 达到 59.43指令遵循IFEval 88.35、IFBench 65.33复杂约束任务表现出色综合成绩十项基准宏平均 64.87比基座 Qwen3.5-4B58.94高出5.93此外它原生支持 262,144 token 上下文BF16 精度的 4B 规模对显存相对友好单机 GPU 即可承载适合个人和小团队自托管。模型权重格式为 Safetensors可通过 model.safetensors.index.json 查看分片索引。准备工作下载 NeoHorse-1-4B 模型权重部署前先把模型下载到本地目录。仓库地址git lfs install git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B下载完成后目录中应包含以下关键文件文件作用config.json模型结构配置model_type为qwen3_5_text最大位置编码 262144tokenizer.json / vocab.json分词器词表chat_template.jinja对话模板含思考模式thinking支持model-00001-of-00002.safetensors 等BF16 模型权重分片 提示config.json 中可见该模型采用线性注意力与全注意力混合的层结构full_attention_interval为 4这也是长上下文下推理效率较高的重要原因。命令一安装 SGLang 推理引擎官方技术报告使用的版本是 SGLang v0.5.17建议固定版本以保证行为一致pip install sglang0.5.17SGLang 是一个高性能大模型服务框架支持 RadixAttention 前缀缓存、连续批处理等优化天然提供 OpenAI 兼容接口。命令二一条命令启动 NeoHorse-1-4B 服务python3 -m sglang.launch_server \ --model-path /path/to/NeoHorse-1-4B \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder关键参数速览--served-model-name neohorse-1-4b对外暴露的模型名后续 API 请求中填写这个名字--context-length 262144启用完整的 262K 上下文若显存不足可适当调小--reasoning-parser qwen3解析思考模式输出enable_thinking--tool-call-parser qwen3_coder启用工具调用解析这是智能体场景的必备项服务启动后会暴露 OpenAI 兼容的/v1/chat/completions端点。命令三发送第一个 OpenAI 兼容请求curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:neohorse-1-4b,messages:[{role:user,content:Write a Python function that returns the first n Fibonacci numbers.}],max_tokens:512}看到返回的 JSON 流式内容说明 NeoHorse-1-4B 已经成功运行 。任何支持 OpenAI SDK 的框架LangChain、OpenAI Python SDK、各种 Agent 框架只需把base_url指向http://localhost:30000/v1即可无缝切换。常见问题与最佳实践Q1显存不够怎么办4B BF16 权重约 8GB加上 262K 上下文的 KV Cache 占用会更大。显存紧张时优先降低--context-length或改用--quantization量化加载。Q2如何启用思考模式NeoHorse-1-4B 支持 thinking 模式chat_template.jinja 中已内置相关模板逻辑。评测协议中使用的采样参数可供参考temperature1.0、top_p0.95、top_k20、presence_penalty1.5。Q3没有 GPU 或想用别的框架README 中同样提供了 vLLM 部署方式--max-model-len 262144配合相同的 reasoning/tool-call parser可参考 README.md 的 Deployment 章节。Q4商用许可是什么项目采用 Apache License 2.0 许可可自由商用详见 LICENSE。总结用 SGLang 部署 NeoHorse-1-4B 只需 3 步安装指定版本 → 启动服务 → 发送兼容请求。部署完成后你就拥有了一个具备工具调用、编码和长上下文能力的 4B 级智能体模型 API可以直接驱动 Agent 应用、代码助手或工具编排系统。更多基准数据与模型细节可查阅 README.md 与模型配置 config.json。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考