首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
AI辅助投研实战:能力边界、翻车场景与可复用工作流设计
📅 2026/10/1 1:32:12
✍️ 爱科研究院
👁 阅读 3,247
做AI投资研究这个系列写到第三篇后台问得最多的问题终于从“用哪个模型”“数据怎么接”变成了特别朴素的一句AI到底能不能帮我做投资决策。这问题我完全理解工具聊得再热闹落不了地都是白搭。但我也没法用一个“能”或者“不能”来回答因为投资研究是一条完整链路从数据收集、信息抽取、逻辑分析到最终决策每个环节对AI的要求完全不同它的表现也天差地别。这篇把我大半年实操里摸出来的能力边界按“擅长”和“不擅长”两堆摆开来再给一套顺着边界设计出来的AI辅助投研工作流。想做AI投研的、想搭量化辅助工具的、甚至在交易决策前想引入AI把关的读者看完都能直接照着搭。先说清一个前提这篇是系列第三篇前两篇讲的是工具选型和数据工程所以模型怎么装、接口怎么调这类基础问题不再展开。这一篇的重心放在“AI在投研里到底干什么靠谱、干什么不靠谱”以及“靠谱的部分怎么接进工作流”。我聊的是自己实测过的场景不是厂商宣传册上的场景。下面进入正题。1. 为什么先画能力边界而不是直接谈模型选型很多人上来就问“哪个模型最强”其实这是个错误的问题。模型强不强要放到具体任务里才算数。同一家大模型让它总结一篇两万字研报能打90分让它判断一家公司明年现金流是不是会被抽干可能只能打40分。问题不在模型在于投研任务的属性差异太大。先画清楚能力边界再谈选型和编排顺序不能反。1.1 投研链路是一条分工链不是一块整蛋糕我把投研链路简化成四段数据获取 → 信息抽取 → 逻辑分析 → 决策执行。这四段对“判断力”的要求是逐级上升的AI的适配度则是逐级下降的。拿厨房打比方数据获取是洗菜切菜信息抽取是配菜逻辑分析是掌勺决策执行是决定这桌菜给谁上、怎么定价。你不能因为AI刀工好就让AI去掌勺也不能因为它不会颠勺就干脆不让它碰刀——正确的做法是让合适的工种干合适的活儿。四段链路具体长这样链路环节典型任务对判断力的要求AI适配度数据获取爬公告、拉行情、对接财报、清洗脏数据低高可高度自动化信息抽取从PDF里提指标、抽取事件、汇总舆情观点中低高但需人工抽检逻辑分析财务异常识别、行业对标、因子初筛、逻辑推演高中只能给辅助结论决策执行买卖判断、仓位设计、风险敞口控制极高低必须人来签字这个分层不是拍脑袋是我踩过坑之后总结的。早期我试过让AI直接输出“这家公司值不值得买”的结论它给出的报告结构完整、逻辑自洽但关键假设错了一个整条推理链就全歪了。后来我把决策环节完全收回来AI只负责前两段和第三段的部分辅助体系才真正稳定下来。1.2 能力边界直接决定人机协作的成本结构边界画错成本会悄悄爆炸。太信任AI让它在不擅长的环节做判断翻车一次的代价可能吃掉节省下来的所有时间太不信任AI什么都人工复审那跟不用AI没有任何区别还多了一道校验负担。边界画对之后协作成本会明显降下来——简单抽取和整理全自动跑中等任务AI出初稿人做抽检高判断力任务AI列证据人做裁决。这里有两类人最容易被带偏。一类是“AI全能论”觉得大模型什么都能干把投研报告整个外包给Agent出事了才发现它连引用的文件页码都是编的。另一类是“AI无用论”试了一两次觉得答得泛、不准就彻底放弃。两种极端的根源都一样没有给AI划定该干和不该干的活。我的经验是先给每个任务打三个标签——容错率、资料充分度、判断权重。容错率高、资料充分、判断权重低的任务放给AI反过来必须人下场。这三个标签打完之后能力边界基本自己就浮出来了。2. AI真正擅长的四类投研任务抛开概念炒作我在实际工作流里反复验证后认为有四类投研任务AI表现得稳定且可靠。它们有一个共同特征输入清晰、规则明确、输出结果可核验。只要具备这三个条件AI就能干得又快又好。2.1 非结构化数据的批量清洗与语义抽取投研里最耗时间的活儿不是读报告而是从一堆非结构化文档里把关键信息抠出来。业绩说明会纪要、年报PDF、券商研报、专利文件、招股说明书格式五花八门表格横七竖八。过去这个环节靠实习生一页页翻一个人一天能处理五家公司已经算快现在用大模型配合解析管线半小时能把二十家公司的核心指标抽完。我实际跑得最多的一个任务是这样的从近三次业绩说明会的逐字稿里抽每家公司管理层对“毛利率”表述的变化输出格式是“原文引用 会议日期 语气判断乐观/中性/谨慎”。过去这个需求要人工听录音、翻纪要、比对措辞现在模型处理完我再花二十分钟抽查引用是否属实即可。多语言场景更是AI的绝对优势区英文财报、日文IR资料、韩文披露文件都能直接进同一套抽取流程不需要再配多语种实习生。这类任务能跑通的关键是给足约束。我会在提示词里要求输出必须带来源标签文档编号页码数字必须保留原单位抽取不到的字段写“未披露”而不是瞎猜。模型一旦被要求给出来源编造比例会大幅下降。这一招是整条工作流里最值得先做的改造。2.2 财务异常信号的机器嗅觉财务分析里有一类工作是“找不同”机器比人擅长得多。不是算个资产负债率就完事而是做跨期、跨科目的联动异常检测。比如一家零售连锁公司营收连续高增长但经营现金流三年为负比如应收账款增速长期高于收入增速比如存货余额占营收比重逐年抬升——单看某个指标都不算事放在一起就是典型的“红旗信号”。AI能做的不只是把这些指标算出来而是能结合财报附注里的叙述把“哪里变了”用自然语言讲清楚。我常用的做法是让模型同时读三年的资产负债表、利润表、现金流量表和附注原文输出一组“财务异常信号清单”每个信号带一句解释和对应的报表位置。再进一步可以让AI做同业对标——把目标公司和它的三到五家可比公司放在一起让模型逐项对比关键科目的变化路径。这个能力人也有但人看五家公司各三年报表需要一下午AI跑完只需要几分钟而且不容易漏项。要特别强调的是AI找到的是“信号”不是“结论”。它告诉你这里有异常至于这个异常是财务舞弊、业务扩张还是行业周期所致需要人去定性。把AI定位成一台灵敏度调高了的X光机而不是诊断医生是很重要的一条边界。2.3 舆情情绪的连续量化传统文本情绪分析用关键词词典打分“业绩超预期”这种明确表达还凑合一旦碰到反讽、含蓄、有保留地夸奖词典就彻底失灵。大模型在这方面的优势是能理解语境把“虽然增速下滑但核心产品放量”这类句子准确判成中性偏乐观而不是只看表面词义。我跑通的一个实用产品是“舆情情绪脉冲指数”。流程是把跟踪池里的新闻、公告、主流财经媒体评论、产业论坛讨论按小时抓下来用模型做立场分类和强度打分再聚合成一条时间序列。我们拿它做了个回测对照发现情绪脉冲对短周期波动相关性比较明显尤其是财报发布和产品发布这类事件窗口前后。这不构成交易策略但能提前告诉你“市场正在用什么样的情绪看待这家公司”帮你给主观判断加一圈护栏。这个场景有个容易被忽略的细节模型要分类的是“市场表达的情绪”不是“模型自己的观点”。我在提示词里会强制要求模型站在“一个理性市场参与者”的立场上去解读文本情绪避免模型用自己的偏好污染结果。实测下来这个立场设定对输出质量影响非常大。2.4 研究工具链的快速搭建最后这类的价值被很多人低估AI是极好的“投研工具生成器”。数据分析脚本、PDF解析器、SQL查询、数据清洗代码、回测框架的骨架代码这些脏活累活大模型都能快速给出可用的初版。我自己的协作方式是把任务描述成“人话需求”比如“帮我写一个Python脚本把这个文件夹里所有PDF季报的现金流量表抽出来统一换算成万元单位输出成csv按股票代码和报告期排序”。模型生成初版代码我在隔离环境里跑通、改错、验证边界条件整个过程通常不超过四十分钟。作为一个不靠写代码吃饭的人这个效率提升是非常可观的。需要提醒的是AI生成的代码必须经过人工审查之后才能碰数据放在隔离环境里跑别拿生产库试错。它帮你省的是从零到一的时间不是从一到百的验证责任。代码审计这件事不能交给AI自己这是底线。3. AI不擅长、容易翻车的地方这部分比上一部分更重要。我把AI在投研里的翻车现场分成了四类每一类我都见过真实案例。这些场景的共同点是高不确定性、强先验判断、样本稀疏或存在隐性因果。碰到这类任务AI不仅帮不上忙还可能用看似严谨的输出把人带进沟里。3.1 结构性拐点与“灰犀牛”的预判AI的基本操作逻辑是外推从历史分布里找规律然后顺着规律往前推。这在分布稳定的时候很好用但投资世界里最难的恰恰是分布突变。电池替代燃油、传统零售被电商重构、大宗供应链重组、消费习惯一夜跳到新品类——这些结构性拐点发生时过去的数据只能告诉你“曾经大致这样”不能告诉你“这次完全不同”。我做过一个测试让模型分析某个正在被新技术替代的传统行业它给出了一份堪称教科书级别的报告列举了过去二十年历次类似转型的演进路径最后结论落在“历史上此类替代周期通常持续五到八年”。问题在于这一次的替代斜率远超历史均值如果按历史外推去做仓位管理损失会非常大。模型不是不想说而是它的训练数据和推理结构里就没有“反事实跳跃”这个能力。它可以把历史类比摆出来但“这次不一样”的判断只能由人来下。3.2 商业模式与护城河的“体感”判断巴菲特和芒格的框架模型背得比谁都熟。护城河四要素、波特五力、自由现金流贴现模型它能给你写出一篇漂亮的深度报告但落到具体某家公司的“护城河现在还在不在”它往往只能基于公开信息编织叙事。问题在于护城河的真正变化经常发生在公开信息看不到的地方核心渠道商的态度、中层团队的稳定性、创始人的心力状态。我给模型做过一次“双盲对照式”的评估让它分析两家业务形态几乎相同的消费品牌结果它对两家公司的护城河评价高度相似。但现实是其中一家的分销体系已经出现大面积流失终端动销持续走弱——这些信息不在公开资料里却恰恰是护城河松动的最早信号。AI最好的用法是帮我把这家公司历史上所有关于渠道、定价、复购的公开讲述整理成背景简报至于“这家公司还值不值得信任”的判断我必须去走访、去和一线渠道聊再自己做决定。AI做不了田野调查这就是它在这个环节最大的天花板。3.3 小样本低流动性资产上的统计幻觉数据越少AI越容易“自信地胡说”。这不是态度问题是统计规律问题——样本量小的时候任何结论的方差都极大模型却不会自动调低置信度。我见过模型对一家只有两年经营历史、五家可比公司的新兴行业企业给出“预计未来三年收入复合增速30%以上”的测算还配了完整的假设表。听着很专业实际上所有假设都建立在极少的样本点上多一个数据点就能让结论完全翻转。处理这个问题的原则是在小样本区间只让AI做“列清单”的工作不让它做“下判断”的工作。列的清单包括哪些数据是缺失的、哪些假设是脆弱的、哪些风险是尚未被价格反映的。也就是说让它帮我们意识到“无知”的边界而不是让它假装“有知”。3.4 因果推理与反事实分析AI非常擅长发现相关关系但因果推断是它最明显的短板之一。销量上升、广告投放增加、竞品提价、消费旺季到来这些因素同时在发生AI很容易把相关当因果给出“广告投放导致了销量上升”这种站不住脚的结论。更麻烦的是反事实问题——“如果没有发生某起突发事件这家公司现在会怎样”。模型无法真正模拟现实中从未发生的路径它只能生成一种听起来合理但不可验证的叙事。我把这部分的赌注压在“人先假设AI验证”。我会先自己提出一个因果假设然后让AI去数据里找支持或者反驳的证据并要求它把反证找出来。这时候AI更像一个速度极快的“魔鬼代言人”而不是决策者。这个分工我用下来很顺手既保留了人的判断框架又利用了AI的检索和归纳能力。4. 一套可复用的AI辅助投研工作流边界讲清楚了接下来就是把这些认知落成一套能天天跑的系统。我设计的工作流不追求炫技核心是三句话数据层管全、分析层分工、决策层留痕。这套东西已经在我自己的日常研究里稳定运行了半年可以直接复制。4.1 三层架构数据中台、分析Agent、决策层整个系统分成三层各司其职。第一层是数据中台。公告、财报、研报、新闻、行情数据统一入库非结构化文档做解析和切块后进入向量库结构化数据进关系型数据库或数据仓库。每天晚上定时跑增量更新并对数据质量做校验比如“财报日期是否在合理范围”“是否出现重复下载”。这一层是地基数据层不干净上面所有层都会跟着出问题。第二层是分析Agent。按职责拆成几个独立Agent每个只做一件事Agent职责输出财务Agent指标抽取、异常信号检测、同业对标JSON 来源引用舆情Agent新闻/社媒情绪分类、事件脉冲识别情绪时间序列新闻Agent重大事件抽取、影响面初步归类事件清单 涉及标的风险Agent持股集中度、波动率、流动性体检风险仪表盘Agent之间不互相串联、不各自改来改去每个Agent的输出都是独立、可核验的。我刻意避免“让几个Agent自由对话去达成共识”的复杂编排因为一旦串联错误会被放大且难以定位到底哪一步出错。第三层是决策层。所有Agent的输出汇总到一个工作台由分析师阅读、质疑、复核最终在决策记录里写下自己的结论和理由。这一层是人的主场。系统可以建议但决定必须人来做。4.2 提示词与Agent的分工细则提示词的设计直接影响Agent能不能守住边界。我常用的系统提示词包含五个固定模块身份与范围、数据源白名单、输出格式、证据要求、不确定性态度。身份与范围这栏会明确写“你是一个投研分析助手只处理以下范围内的任务”不给模型越界发挥的空间。数据源白名单列出允许引用的文件类型和数据库明确禁止模型凭记忆编造公司事件。输出格式统一为JSON字段固定方便下游自动解析。证据要求是最关键的一条所有数字和结论必须带来源标签没有来源的结论不允许进入输出。不确定性态度则是要求模型在数据不足时直接输出“未发现足够证据”而不是硬凑一个答案。任务拆分也有讲究。一个Agent只配一个职责不要做“全知全能”的大杂烩。比如抽取任务单独一个Agent温度设低追求确定性分析辅助单独一个Agent温度可以稍高允许发散但必须附证据。工具方面我给它挂上网页搜索、计算器和代码解释器让它在需要最新数据或复杂计算时直接调用而不是靠记忆瞎算。4.3 人机复核机制与决策留痕AI辅助投研最大的敌人是“查无实据”所以复核和留痕不是锦上添花是刚需。我在工作流里强制了这么几条规矩凡是进入决策报告的定量表述必须有分析师对原始数据源的签字复核。每次向Agent发起请求系统自动记录提问原文、模型回复、引用来源、复核状态。每周对所有Agent输出做一次抽样人工审计重点检查来源真实性和计算正确性。另外我还会用一个“红队”机制决策报告初稿写完后让另一个模型或同一个模型换一个角色专门挑这份报告的漏洞输出“反对意见”。这相当于给决策加一道反向质检很多隐藏假设就是这么被揪出来的。人机协作最理想的状态是AI负责把话说全、把证据摆齐人负责负最后的责。留痕系统能保证出了问题找得到源头这也是让AI投研真正可用的底线。5. 实操中的坑与排查技巧最后这部分是纯实战记录。我在跑这套工作流的过程中踩过的坑以及对应的排查思路全部整理在这里属于常规文档里最不容易看到的内容。5.1 幻觉是所有投研应用的“头号公敌”模型生成一份看起来严谨的报告里面引用的研报标题是编的、某个财务指标数值是错的、某位分析师的表态是综合出来的——这是我在实践中遇到频率最高的问题。它的可怕在于幻觉往往出现在最不显眼的位置而投研恰恰吃“细节可信度”。我的排查手段有三个。第一强制来源引用所有关键陈述必须指向可打开的文件位置凡是引用含糊的一律打回重做。第二用代码解释器独立验算关键财务比值不让模型“自己算自己答”。第三把输出区分为两个区块一个是“事实摘要”原文里有的内容一个是“模型推断”基于摘要的延伸判断让复核人一眼分清哪些是证据、哪些是推测。这套做法下来幻觉虽然不能彻底清零但已经压到可以接受的水平。5.2 训练数据截止导致的知识断层大模型的知识有截止日期但市场没有。我遇到过一个典型案例让模型分析某家公司的竞争格局它输出的行业排名还是三年前的版本完全没有反映期间发生的重大技术路线变更。更麻烦的是模型不会主动告诉你“我知道的信息可能过时了”。应对方案是给系统接上动态检索。所有涉及“当前状态”的问题先走数据中台的最新资料库再用模型做理解和归纳。给模型的提示词里必须写明当前日期并明确要求“只基于检索到的资料而不是内置记忆”。就算这样偶尔还会发生模型把记忆和检索结果混在一起的情况所以人工复核的重点之一就是对比“模型的回答”和“原始资料”之间有没有悄悄夹带老知识。5.3 回测里的过拟合与幸存者偏差只要让AI参与因子挖掘和策略回测你就会遇到一个老朋友过拟合。模型为了在历史上表现好看会在参数空间里试很多次结果就是它“记住”了历史噪声而不是规律。我见过AI生成的因子在样本内夏普率漂亮得吓人出了样本就一塌糊涂。排查技巧是强制做三件事。一是样本外验证把历史数据严格分成训练段和验证段模型只能在训练段上优化验证段只跑一次。二是考虑交易成本和滑点不然回测收益会被手续费吃光。三是限制参数搜索空间和调参轮数不要给AI无限试错的机会。幸存者偏差则要靠数据快照来解决——回测使用当时的股票池而不是现在的股票池否则会把退市公司全部漏掉结果必然虚高。这几点都是回测系统里容易忽略、但只要忽略就必翻车的地方。5.4 选模型与控成本的经验值最后聊一下模型选型和成本控制这部分我踩过不少冤枉路分享几个经验值。分层使用模型是控成本最有效的办法。抽取、分类、标签化这类规则明确的任务用小模型或开源模型就够了速度快价格低需要综合多份材料、做复杂推理的任务再上旗舰大模型。我给自己定的比例是大约八成任务走轻量模型两成走重量模型月成本比全用大模型下降了百分之六十以上。另外要关注Token消耗的“重灾区”。最容易烧钱的地方不是单次长文本分析而是反复失败的Agent调用。如果Agent经常超时、报错、返回格式不合格排查起来非常耗时还费Token。我的处理方式是给所有Agent调用加超时和重试上限输出格式严格用JSON Schema校验格式不对直接按失败处理。这样虽然丢弃了一部分“可用但格式错”的结果长期来看反而省了更多钱。数据安全也是个需要提前考虑的问题。涉及敏感的持仓和交易数据我倾向用本地部署的模型或者私有化API不把核心数据传给外部公共接口。这不是说公共接口不能用而是要在数据分类之后再做决定别把底牌一股脑交给外部系统。写在最后这套AI辅助投研体系用下来我最大的收获不是“AI替我赚了多少钱”而是它逼着我把自己的判断过程变得比过去更清楚。人负责方向和判断AI负责广度和一致性两边守住各自的边界决策质量才真正往上走。如果只让我给一个起步建议那就是不要一上来就搭复杂Agent编排先挑一个单一环节做替换——比如每天让AI把跟踪池里公司的财报要点和异常项列出来你花十分钟复核一遍连续跑两三个月。跑完之后你会很自然地知道哪些环节适合放权哪些环节必须攥在自己手里。那张你自己摸出来的“能力边界图”比任何模型评测榜单都值钱。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/1 1:32:12
OpenHarmony I2C驱动开发与排障:从HDF配置到稳定数据读写
2026/10/1 1:32:12
Windows下CUDA与cuDNN安装配置指南:版本匹配与验证全流程
2026/10/1 1:32:12
如何用Rust写一个C预处理器:claudes-c-compiler宏展开与include处理完整解析
2026/10/1 2:22:15
LaTeX 论文排版实战:Windows 下 TeX Live 安装与报错排查
2026/10/1 2:22:15
MCU EFT抗扰设计:电源滤波、接口防护与PCB布局实战指南
2026/10/1 2:22:15
戴尔G15伪黑屏排查指南:背光不亮别换屏,从驱动到排线全解析
2026/10/1 2:22:15
主模式RTL设计:状态机与三态驱动的完整实现指南
2026/10/1 2:22:15
大西洋明珠马德拉:七天徒步自驾与美酒全攻略
2026/10/1 2:17:15
全覆盖路径规划(CCPP)原理与工业落地实战指南
2026/10/1 0:01:36
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/1 0:01:36
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/1 0:01:36
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)
2026/9/29 11:29:08
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
2026/9/29 13:01:36
新手入门看这篇:建设网站加盟避坑指南与SEO实操
2026/9/29 14:07:33
论文AIGC疑似度是什么意思?想查论文AI率有哪些免费工具?
2026/10/1 0:01:36
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/1 0:01:36
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/1 0:01:36
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)