首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
GitHub 开源 Qwen-MM-Plugins 小白入门,给 Codex 装上多模态工具箱
📅 2026/8/12 16:36:50
✍️ 爱科研究院
👁 阅读 3,247
GitHub 开源 Qwen-MM-Plugins 小白入门给 Codex 装上多模态工具箱把一张 4K 仪表盘截图交给 AI 编程助手要求它读出所有数字。这个任务看着只差一句提示词程序真正做起来却要连续解决几件事。图片怎样缩放细小文字要不要再放大什么时候该转 OCR返回结果又怎样送回模型。换成两小时视频、带图表的 PDF 或 3D 模型文件处理还会继续变复杂。Qwen 团队新开源的 Qwen-MM-Plugins 就在处理这一段。它给 Codex、Claude Code、Qwen Code 等 Agent Harness 提供 Skill 和 MCP 工具让 AI 可以按任务读取图片、视频和文档也能接入 OCR、目标定位、语音识别、联网搜索、视频记忆与 3D 软件。我在 2026 年 8 月 10 日核对了仓库的中英文 README、安装文档、pyproject.toml、插件清单、核心 Skill、MCP 框架和多个工具处理器也查看了 Issues、许可证与安全说明。GitHub API 当晚显示831 Stars、42 Forks。仓库创建于 2026 年 7 月 29 日当前源码版本写作1.0.0尚未发布正式 Releasemain分支仍在快速更新。 专栏介绍 《GitHub小白开源成长课》这个专栏写给计算机初学者、大学生和刚接触 AI 开源项目的读者。每篇文章挑一个值得动手的 GitHub 项目读源码查依赖也把费用、许可证和使用边界讲清楚。读完以后你至少能判断这个项目解决什么问题自己能不能跑以及下一步该从哪个文件学起。如果你正在从“会收藏项目”走向“能读懂项目”可以关注这个专栏。后面还会继续拆解 AI 编程、多模态工具和 AI 内容创作方向的开源项目。AI 编程助手为什么还要装一套多模态插件一个 Agent 能不能读图片通常取决于三处条件。模型本身要支持视觉输入宿主程序要能把文件交给模型任务复杂时还要有负责渲染、抽帧或识别的工具。任何一处缺失用户都可能得到一句“我无法直接查看这个文件”。Qwen-MM-Plugins 把第三处整理成了可单独安装的能力包。当前插件市场列出七项可用能力。能力适合处理的任务小白要先知道的条件core读图片、视频、文档与 3D 文件提供 OCR、目标定位、ASR 和搜索最适合作为第一站部分功能需要 API Keyvideo-memory为长视频构建层次化图记忆再按时间和语义检索构建与查询都需要 DashScope Keyomni-av音视频转写、分段描述、时间定位、事件计数与音乐标签默认调用 Qwen-Omni 服务video-edit视频剪辑工作流与图片、视频、音频生成生成类服务会产生费用blender驱动正在运行的 Blender 建模、加材质和渲染工具可以在 Blender 内执行 Pythonfreecad驱动正在运行的 FreeCAD 建模、导出与 FEM 分析需要 FreeCAD 与随包插件edu-agent把数学或理科题做成中文讲解视频或交互页面纯 SkillNode、Chromium、TTS 等依赖要手动准备项目名里的MM可以理解为 MultiModal也就是多模态。这里的插件也不局限于“让 Qwen 模型看图”。仓库已经为 Codex 等多种 Harness 准备了插件清单MCP 工具返回的内容会继续交给当前 Harness 使用的模型。这也带来第一个判断。只想让 Codex 读一张图片的人先装core就够了。七项能力一次装齐会提前拉入 3D、视频生成和长视频记忆所需的依赖排错范围随之变大。Skill 指路MCP 工具动手Qwen-MM-Plugins 的每项能力通常由两部分组成。Skill 是一份写给模型看的使用说明。src/capabilities/core/skill/SKILL.md会告诉 Agent 当前有哪些工具遇到图片、视频、网页或 PDF 时应该怎样选择还写了分辨率预算和视频抽帧策略。MCP Server 是真正执行工作的 Python 程序。它通过标准输入输出与 Harness 通信把read_image、visualize、ocr等函数暴露给 Agent。模型选定工具后Harness 传入文件路径与参数MCP Server 读取或处理文件再把文字、图片或生成文件送回来。可以把 Codex 看成工作台。Skill 放着操作手册MCP Server 放着扳手和仪器。只复制 Skill模型会知道应该做什么手边仍然没有可调用的工具。只注册 MCP Server工具虽然存在模型缺少完整的选择和使用说明调用质量也可能下降。当前core源码会自动发现 15 个工具。它们分布在读取器、可视化器、外部 API 和结果生成器四组目录中。一组工具代表工具做了什么本地读取read_image、read_video、media_info读取图片按时间抽视频帧查看编码和时长文件可视化visualize把 PDF、Office、代码、表格、3D 等文件转成模型可读的内容外部识别vision_chat、ocr、grounding、transcribe_audio调用 DashScope 模型理解画面和声音联网能力web_search、web_extractor、image_search通过 Serper 搜网页或反向搜图结果处理crop、draw_bbox、save_view裁图、画框和保存指定页面或视频帧源码里的动态分辨率也很具体。read_image会按small、normal、large三档预算缩放图片并把宽高对齐到 32 像素的网格。默认normal大约按 1024 个视觉 Token 的像素预算处理。它随后把图片编码成内容块返回给模型。这套处理可以减少过大图片占用的上下文也能把很小的图片适当放大。它不会凭空恢复已经丢失的文字。原图模糊、压缩严重或截图缺了一角模型仍然只能根据现有像素判断。官方 Codex 案例里发生了什么项目的 core Cookbook 给出了一段 Codex 官方轨迹。用户先让 Codex 找出图片中的蛋糕并画框随后又让它识别另一张图片中的地点并用联网搜索交叉核对。这是一个很合适的入门案例因为它连续用到了观察、定位、标注和验证。仓库没有在 README 里给出统一准确率也没有公布这组案例的完整评测数据所以我们可以学习调用流程不能拿一段演示证明它对所有图片都可靠。蛋糕定位对应grounding工具。处理器会把图片和定位提示发给默认模型qwen3.7-plus要求模型返回归一化到 0 至 1000 的边界框。源码再根据原图宽高换算成像素坐标。用户需要可视化结果时draw_bbox使用 Pillow 在原图副本上画框并尝试寻找支持中文的字体。地点识别多了一步外部核对。模型先根据画面形成候选再用搜索结果确认。这里能看出插件对工具边界的态度。画面相似不等于身份已经确认特定地点、人物、物种或事件需要额外证据。反向搜图的隐私代价也藏在这条流程里。Serper Lens 需要公开图片网址。image_search.py发现输入是本地文件时会先要求allow_public_uploadtrue。用户同意后图片或裁剪区域会上传到第三方公共图床uguu.se再进入搜索。源码和工具描述都提醒内容会离开本机并公开可访问。因此第一次练习可以用自己画的几何图或公开素材。身份证、实验原图、未公开论文截图和公司内部页面都不适合拿来试反向搜图。本地读取和云端识别走的是两条路README 写着“原生读图、视频、文档不需要 Key”。这句话只描述插件自身是否调用 DashScope。文件经过read_image或visualize处理以后返回内容仍要交给 Agent 使用的模型。你在云端模型上运行 Codex图片或渲染页面仍可能进入该模型的请求。数据去向可以按下面这张表理解。操作插件会访问的外部服务还要检查什么read_image、read_video、visualize插件处理阶段不要求 DashScopeHarness 使用的模型是否在云端返回内容怎样保存ocr、grounding、vision_chatDashScope账户地域、模型价格和服务数据政策transcribe_audioDashScope或用户配置的自建 ASR 服务音频是否包含个人信息和未公开谈话web_search、web_extractorSerper查询词会发送给搜索服务image_searchSerper必要时还会访问uguu.se本地图公共上传需要用户明确同意blender、freecad本机正在运行的 3D 软件也可能访问素材服务工具可以执行 Python要按本地代码执行管理权限项目提供了一些默认上限来控制资源占用。visualize默认最多处理 20 页read_video的返回帧数默认硬上限为 600单次工具响应默认上限为 15 MiB。vision_chat处理本地视频时默认最多抽 128 帧参数会限制在 250 帧以内。源码建议超过约 40 分钟的视频改用read_video长视频问答则可以考虑video-memory。这些数值都是当前版本的工程默认值。提高上限会增加内存、传输和模型上下文开销也可能触发更高 API 费用。安装前先看清自己的系统pyproject.toml要求 Python 3.10 及以上。日常安装由uvx在第一次启动某项能力时创建隔离的 Python 环境。你还需要一个受支持的 Agent Harness例如 Codex以及能访问 GitHub 和 Python 包源的网络。不同文件类型还会用到系统工具。系统工具相关功能Ubuntu 安装提示macOS 安装提示ffmpeg与ffprobe视频读取、媒体信息、ASR、长视频记忆和视频编辑sudo apt install ffmpegbrew install ffmpegLibreOfficeOffice 与 DrawIO 可视化sudo apt install libreofficebrew install --cask libreofficeBlender3D 文件的高质量渲染sudo apt install blenderbrew install --cask blenderTeX Live编译 LaTeX 文件sudo apt install texlive-latex-base texlive-latex-extra按 TeX Live 官方说明安装Chromium网页截图playwright install chromiumplaywright install chromiumBlender 属于可选项。没有它时部分 3D 可视化会回退到 matplotlib。Office、LaTeX 和网页截图则要准备各自的外部程序。仓库当前没有Dockerfile或docker-compose.yml也没有.env.example。官方路线是插件市场加uvx密钥与参数写进~/.qwen-mm-plugins/config或通过系统环境变量提供。Windows 用户要多走一步。官方文档当前只支持 WSL2原生 Windows 尚未验证。先在管理员 PowerShell 安装 Ubuntu。wsl--install-d Ubuntu重启 Windows 和 Codex 后把 Codex 的 Agent 环境切到 WSL2。仓库应该克隆到 WSL 的 home 目录例如~/code不要放在/mnt/c这类 Windows 挂载盘下。一条稳妥的安装路线官方 README 给出的快捷命令会把远程脚本直接交给 Bash。curl-fsSLhttps://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh|bash这条命令很省事也要求你在执行前信任远端main分支。初学者可以多走两步先克隆并查看脚本再运行同一份官方安装器。cd~gitclone https://github.com/QwenLM/Qwen-MM-Plugins.gitcdQwen-MM-Pluginsgitrev-parse HEADlessinstall.shbashinstall.sh安装器会让你选择 Harness 和能力。第一次只勾选core。它还可以执行配置、自检和卸载配置文件写到~/.qwen-mm-plugins/config。想直接使用 Codex 自己的插件命令也可以执行当前 README 提供的两条命令。codex plugin marketplaceaddhttps://github.com/QwenLM/Qwen-MM-Plugins.git codex pluginaddqwen-mm-plugins-coreqwen-mm-plugins已经添加过这个 Marketplace准备获取后来新增的能力时先更新市场信息。codex plugin marketplace upgrade qwen-mm-plugins随后在克隆目录运行配置和验证。bashinstall.sh configurebashinstall.sh verifyverify会预拉取所选能力的uvx环境检查 API Key 和系统工具。第一次启动可能花一段时间因为core会带上 PDF、表格、GIS、3D 与网页可视化所需的一批 Python 包。需要使用云端工具时配置文件大致会出现下面这些字段。示例全部使用占位符。DASHSCOPE_API_KEYYOUR_DASHSCOPE_API_KEY SERPER_API_KEYYOUR_SERPER_API_KEY SAM3_SERVER_URLhttp://127.0.0.1:8787日常只读图片和文档可以先不填任何 Key。OCR、目标定位、视觉对话和 DashScope ASR 需要DASHSCOPE_API_KEY。联网搜索需要SERPER_API_KEY。图像分割要自己启动 SAM3 服务并填写地址。密钥不要写进提示词、截图或仓库文件。安装器会尝试把配置权限设为0600提交代码前仍应检查git status。费用从哪里产生Qwen-MM-Plugins 本身采用 Apache-2.0 许可证不收软件许可费。实际使用成本来自 Agent 模型、外部 API、本机计算和下载依赖。read_image与visualize不会额外调用 DashScope返回内容会占用 Agent 模型的上下文。OCR、目标定位和视觉对话默认使用qwen3.7-plus。阿里云百炼在 2026 年 8 月 10 日的华北 2 北京标准价表中256K Token 以内的输入标价为每百万 Token 2 元输出标价为每百万 Token 8 元。页面还可能出现限时折扣模型别名、地域和价格也会变化使用前应重新查看 百炼模型价格。语音识别、Omni 音视频理解、TTS 和图片视频生成使用各自模型计费口径并不相同。video-memory构建阶段还会做多次视觉理解与嵌入计算。项目因此没有给出“一段视频多少钱”的固定答案。控制费用可以从任务规模入手。先处理一张公开小图再试一页 PDF。视频先看媒体信息限制时间范围和抽帧数。准备调用 API 时开启服务商的费用告警任务结束后查看账单明细。免费额度只适合当作试用条件不能写进长期预算。安全和许可证边界这个项目有几处权限很高的能力。Blender 的主要建模工具可以在正在运行的 Blender 内执行任意 Python。FreeCAD 也提供执行 Python 的工具。脚本能访问什么取决于对应应用进程拥有的权限。用于陌生仓库或不受信任提示时应先使用隔离环境并限制可访问目录。重要模型文件要保留备份。插件清单当前通过githttps://github.com/QwenLM/Qwen-MM-Plugins.gitmain启动uvx环境。帮助文本也说明每次启动会重新解析这个 Git 引用。仓库当前没有 Python 锁文件多数可选依赖也没有固定到精确版本。个人学习可以跟随更新团队和生产环境更适合审查源码后固定提交哈希与依赖版本避免同一条命令在不同日期拉到不同代码。Apache-2.0 允许使用、修改和分发也包含专利授权条款。重新分发修改版时需要附带许可证修改过的文件应留下醒目标记并保留相关版权、专利和署名说明。Blender 与 FreeCAD 能力还内置了第三方 MIT 许可代码仓库分别提供NOTICE.md。代码许可证只约束这份项目源码。Qwen 模型、DashScope、Serper、公共图床和其他素材服务各有自己的条款。准备商用或提供在线服务时要把这些条款分开检查。我喜欢它的地方也要接受它现在的限制Qwen-MM-Plugins 最有价值的设计是把能力拆成独立插件。一个刚入门的人可以只装core等真的要处理长视频或 3D 模型时再加新能力。Skill 与 MCP 的分工也很清楚适合拿来学习 Agent 怎样发现工具、传参并接收结果。文件支持范围很宽。PDF、Office、代码、表格、字幕、DrawIO、GIS 和 3D 文件都有对应路径。缺少外部程序时工具会尽量返回明确提示其他能力仍能继续用。仓库还提供测试、格式检查、贡献说明和私密漏洞报告入口。现实限制同样明显。项目创建还不到两周当前没有正式 Release 或版本 Tagmain更新速度很快。Windows 原生环境尚未验证Windows 用户需要 WSL2。core的完整可视化依赖较多首次uvx冷启动可能较慢也会占用更多磁盘空间。新加入的omni-av已进入 README 和源码架构图与部分安装说明还没有同步更新。一些 Cookbook 也仍标着待补充。README 没有提供系统性的准确率、延迟或成本基准。视觉模型会误读小字也可能给出错误边界框。涉及票据、科研数据和工程尺寸时必须保留人工核对。GitHub 页面当前没有未关闭的 Issue 报告但这只能说明当时没有公开待处理项。新项目的真实兼容性还要靠更多环境验证。它适合愿意理解工具调用过程的初学者也适合正在学习 MCP、计算机视觉应用或 AI Agent 的大学生。只想在原生 Windows 上点一下按钮、完全离线处理敏感材料或者马上用于生产系统的人可以先观望一段时间。推荐从这些源码文件开始读文件先看什么README.zh.md能力清单、安装入口和快速示例docs/zh/installation.mdWindows WSL2、各 Harness 配置和系统依赖.claude-plugin/marketplace.json七项可安装能力怎样登记到插件市场src/capabilities/core/skill/SKILL.md模型怎样选择读图、视频、搜索和 API 工具src/mcp_framework.pyMCP 工具怎样自动注册、启动和检查系统环境src/shared/image.py动态分辨率、坐标换算和画框的基础函数src/capabilities/core/qwen_mm_plugins_core/readers/image.py一张图片怎样缩放并返回给模型src/capabilities/core/qwen_mm_plugins_core/visualizers/visualize.py文件扩展名怎样分派到不同渲染器src/capabilities/core/qwen_mm_plugins_core/apis/image_search.py公共上传同意怎样在代码里强制执行pyproject.tomlPython 版本、依赖分组和七个命令行入口阅读时可以沿着一次调用往下走。先在 Skill 里找到read_image再看readers/image.py的参数和返回值最后回到mcp_framework.py看它怎样进入工具清单。理解这一条链以后OCR、视频读取和文件可视化都能用同样的方法继续追。第一次实践只做一件小事准备一张自己制作的公开图片里面放几行文字和一个简单图形。安装core后在 Codex 中引用它并明确限制工具范围。sample.png 请使用 read_image 读取这张图片列出能确认的文字和图形。不要联网不要调用 image_search也不要上传文件。观察 Codex 有没有调用read_image工具返回了怎样的尺寸变化最终回答是否忠于原图。第一轮先不配置 DashScope Key也不碰真实票据。读图链跑通后再换一张公开的模拟票据配置限额很低的测试 Key尝试 OCR。receipt-demo.png 请使用 ocr 提取文字保留原有顺序并单独列出无法确认的字符。不要调用 image_search。把 OCR 结果和原图逐行对照。发现错字时记录原图分辨率、工具参数和错误位置。这样的练习很小却能让你真正看懂一次多模态工具调用经历了哪些环节。如果你想继续学习这类项目可以关注《GitHub小白开源成长课》。后面还会继续拆解适合初学者动手的 AI 编程、MCP 与多模态开源工具。关键官方资料Qwen-MM-Plugins GitHub 仓库Qwen-MM-Plugins 中文 README详细安装说明core 能力官方 Cookbookcore Skill 源码Python 依赖与入口配置反向搜图与公共上传实现安全漏洞报告说明Apache-2.0 许可证阿里云百炼模型价格本文项目状态、Star 数、源码和价格页面核对日期为 2026 年 8 月 10 日。所有配图均根据当前源码流程重新绘制未复制项目官方宣传图。GitHubQwen-MM-PluginsCodexMCP多模态AI Agent开源项目Python
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/8/12 16:36:39
存储芯片制造全流程大揭秘!原来小小芯片背后藏着这么多门道
2026/8/12 16:36:35
为什么中医AI升级不是简单买设备?
2026/8/12 16:36:27
仓库管理10大报表模板,新手仓管直接收藏
2026/8/12 16:37:55
Pygame性能优化:脏矩形技术原理、实战与避坑指南
2026/8/12 16:37:47
研发费用中“材料费硬塞”的识别方法——基于领料单与实验记录交叉验证的实务操作指南
2026/8/12 16:37:39
世界模型评测新基准:从因果推理到状态表征的范式变革
2026/8/12 16:37:22
软件测试管理四阶段演进:从救火到防火的质量体系构建
2026/8/12 16:37:06
终极指南:如何用渔人的直感FF14钓鱼计时器提升游戏效率
2026/8/12 16:36:56
AI Agent记忆系统架构设计:从短期对话到长期认知的完整实现
2026/8/12 16:33:47
Figma组件化设计:虚拟角色视觉资产高效生产全流程
2026/8/12 16:33:47
Rust宏系统:编译时代码生成与转换详解
2026/8/12 16:33:47
TVA-World驱动的具身智能交互机制研究