首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
📅 2026/9/30 2:19:56
✍️ 爱科研究院
👁 阅读 3,247
MAC相关研究总结与核心部分翻译一、文章主要内容本文聚焦多模态大型语言模型(MLLMs)在科学理解能力评估方面的挑战,提出了一个动态演进的基准测试集MAC(Multimodal Academic Cover benchmark),并针对MLLMs跨模态科学推理能力不足的问题,设计了轻量级推理方法DAD(Description and Deduction)。1. 现有基准测试集的局限性静态基准测试集(如MMMU)随着MLLMs能力提升逐渐饱和,例如Gemini-2.5-pro在MMMU的pass@1设置下准确率已达81.7%,失去对模型发展的指导意义。现有动态基准测试集(如LiveBench)仅关注单一语言模态,且依赖互联网快速变化的内容,在科学理解评估的数据质量上存在隐患。2. MAC基准测试集的构建与特点数据来源:从Nature、Science、Cell、美国化学学会(ACS)等顶级科学期刊中收集超过25,000个图文对,涵盖分子细胞生物学、材料科学、医学、化学等多个学科领域。核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期间的2287个期刊封面-封面故事对,用于当前MLLMs的评估。任务设计:包含Image2Text(给定封面图选对应封面故事)和Text2Image(给定
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/30 2:19:56
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...
2026/9/30 2:19:55
Finetuning Large Language Model as an Effective Symbolic Regressor
2026/9/30 2:19:55
Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
2026/9/30 2:54:57
Agent-MathModelAgent:从赛题到论文的自动化数学建模智能体
2026/9/30 2:54:57
有了AI以后,数据岗位是不是都要变成全栈?
2026/9/30 2:54:57
74cms骑士人才系统v6.0.4安装部署与二次开发实战指南
2026/9/30 2:54:57
JSP+MySQL高校机房管理系统:从环境搭建到部署避坑全攻略
2026/9/30 2:54:57
EtherCAT协议骨架拆解:帧结构、从站状态机与最小系统搭建
2026/9/30 2:49:57
以 STM32最小系统核心板(STM32F103C8T6)+面板板+3只_(或更多)红绿蓝LED 搭建电路
2026/9/30 0:04:47
扩散模型发展史:从物理热力学到Stable Diffusion的生成式AI进化
2026/9/30 0:04:47
模型优化全链路实践:从训练到部署的优化策略与排障经验
2026/9/30 0:04:47
DeepSeek Agent训练场拆解:沙箱隔离、任务编排与防作弊实战
2026/9/29 11:29:08
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
2026/9/29 13:01:36
新手入门看这篇:建设网站加盟避坑指南与SEO实操
2026/9/29 14:07:33
论文AIGC疑似度是什么意思?想查论文AI率有哪些免费工具?