首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
如何在 dstack 上把 Qwen1.5 30B-A3B 部署为 SGLang 推理服务?(服务配置与端点访问)
📅 2026/9/14 8:59:20
✍️ 爱科研究院
👁 阅读 3,247
如何在 dstack 上把 Qwen1.5 30B-A3B 部署为 SGLang 推理服务服务配置与端点访问【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5Qwen1.5 仓库的部署文档dstack.rst给出了在 dstack 上部署Qwen3-30B-A3B的完整路径编写一份 dstack service 配置文件用 SGLang 镜像拉起推理服务然后通过 dstack 提供的代理端点访问 OpenAI 兼容的/v1/chat/completions接口。本文按该文档整理从初始化工作区、编写服务配置到访问端点的操作步骤。前提是你已经在机器上安装并启动了 dstack并且~/.dstack/server/config.yml中配置了可用的云厂商模型会部署到这些云厂商提供的实例上。准备条件按照 dstack 官方文档安装 dstack 并启动 dstack server。初始化工作区mkdir dstack-qwen-deploy cd dstack-qwen-deploy dstack init确认资源条件文档中的示例配置要求gpu: 80GB:1即 1 张 80GB 显存的 GPU。编写服务配置文件 serve-30b.dstack.yml在工作区目录下创建名为serve-30b.dstack.yml的文件内容如下与源文档一致可直接使用type: service name: qwen3-30b-a3b image: lmsysorg/sglang:latest env: - MODEL_IDQwen/Qwen3-30B-A3B commands: - python3 -m sglang.launch_server --model-path $MODEL_ID --port 8000 --trust-remote-code port: 8000 model: Qwen/Qwen3-30B-A3B resources: gpu: 80GB:1各字段与当前场景的关系name: qwen3-30b-a3b服务run名称后面访问端点时要用到。image: lmsysorg/sglang:latestSGLang 官方镜像容器内已自带 SGLang不需要自行pip install。env中的MODEL_ID在commands里以$MODEL_ID引用的模型 ID 环境变量指向 Hugging Face 上的Qwen/Qwen3-30B-A3B。commands在容器内执行python3 -m sglang.launch_server监听 8000 端口并带--trust-remote-code。port: 8000服务对外暴露的端口与启动命令中的--port 8000对应。model: Qwen/Qwen3-30B-A3B服务对外声明的模型标识。应用配置启动服务dstack apply -f serve-30b.dstack.yml应用配置后dstack 会在已配置的云厂商实例上拉起该服务。服务部署成功后就可以按下面的方式访问其端点。访问服务端点通过 CURL 调用服务端点格式为dstack server URL/proxy/services/project name/run name/dstack server URLdstack server 的地址本机启动时一般为http://localhost:3000project namedstack 项目名文档示例中使用的是mainrun name配置文件中的name字段即qwen3-30b-a3b。在端点后拼接/v1/chat/completions即可按文档示例发送聊天补全请求curl http://localhost:3000/proxy/services/main/qwen3-30b-a3b/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer dstack token \ -d { model: Qwen/Qwen3-30B-A3B, messages: [ { role: user, content: Compose a poem that explains the concept of recursion in programming. } ] }其中dstack token是 dstack 的鉴权 token需要替换为实际的 admin token。文档说明启动 dstack server 时会自动生成一个 admin token例如文档示例不是固定值The admin token is bbae0f28-d3dd-4820-bf61-8f4bb40815da The server is running at http://127.0.0.1:3000/你的实际 token 以启动时输出的内容为准http://localhost:3000中的端口也应以你 server 实际运行地址为准。通过 Chat UI 访问也可以通过 dstack 的 Chat UI 访问模型地址格式为dstack server URL/projects/project name/models/run name/按上面的示例即http://localhost:3000/projects/main/models/qwen3-30b-a3b/。可选分支副本与自动扩缩容开发测试阶段不需要配置 gateway。只有当你需要以下能力时才需要 gateway启用自动扩缩容或限流、为端点启用 HTTPS 并映射域名、服务依赖 WebSocket、或你的服务无法工作在 path prefix 之后。如果需要自动扩缩容可以在serve-30b.dstack.yml中追加如下配置完整示例来自源文档type: service name: qwen3-30b-a3b image: lmsysorg/sglang:latest env: - MODEL_IDQwen/Qwen3-30B-A3B commands: - python3 -m sglang.launch_server --model-path $MODEL_ID --port 8000 --trust-remote-code port: 8000 model: Qwen/Qwen3-30B-A3B resources: gpu: 80GB:1 # Minimum and maximum number of replicas replicas: 1..4 scaling: # Requests per seconds metric: rps # Target metric value target: 10replicas: 1..4定义最小和最大副本数scaling定义扩缩容规则按每秒请求数 rps目标值 10。注意文档明确说明scaling属性要求先搭建好 gateway。限制与边界本文只覆盖 dstack SGLang 这条路径。文档指出 SGLang、TGI、vLLM 都可以用于服务该模型本文以 SGLang 为例其他后端的配置见 dstack 官方的 Inference Examples。资源规格gpu: 80GB:1是文档示例配置的要求如果你的实例规格不同需要自行调整resources文档未给出其他规格下该模型的可运行性说明。本文未覆盖 gateway 的具体配置方法源文档只给出了适用场景并指向 dstack 官方 gateway 文档。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/14 8:59:20
2025小红书私信自动回复工具评测与防封指南
2026/9/14 8:54:20
Qwen3-Coder 评测仓库中 aider 接入 Google Gemini 实战指南
2026/9/14 8:54:20
Flutter跨平台开发:Positioned定位在鸿蒙应用中的实践
2026/9/14 9:39:25
UART、TTL、RS-232、RS-485 三层解耦实战指南
2026/9/14 9:39:25
二进制枚举算法原理与C++实现详解
2026/9/14 9:39:25
STM32F103 PD14/PD15直驱TM1637数码管稳定方案
2026/9/14 9:39:25
ADB调试命令速查手册:从设备连接到应用管理实战
2026/9/14 9:39:25
树莓派+IMX287M实现工业级小目标检测全链路方案
2026/9/14 9:34:24
基于JSP+SSM的大学生创业创新网站开发实践
2026/9/14 0:03:40
KCF目标跟踪算法与OTB工程实现:毕业设计实战解析
2026/9/14 0:03:40
Megatron-LM 推理实战指南:基于 Megatron Core 高层 API 的离线推理与 OpenAI 兼容服务
2026/9/14 0:03:40
语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比
2026/9/14 7:37:16
拯救者Y7000黑屏故障排查与维修实战指南
2026/9/14 2:50:57
AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
2026/9/13 0:01:25
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化