AI 投研框架的反偏见设计
AI 投资
看到 ai-berkshire(AI 时代的伯克希尔),一个用 Claude Code / Codex 跑价值投资研究的 skill 合集,巴菲特/芒格/段永平/李录四大师方法论。把它移植成了 Hermes skill(investment-research / investment-team / financial-data,工具脚本在 ~/.hermes/scripts/ai-berkshire/)。这里记的是它真正值钱的地方——反偏见设计。
为什么直接问 AI 不可决策
直接问"拼多多值不值得买",得到的是"一方面…另一方面…"的平衡分析,最后以"投资有风险"收尾。看起来对,但没法拿来做决策。
问题不在 AI 不能分析,在输出结构:两面讨好 = 没有信息增益。
五个反偏见机制
- 强制给结论 — 输出必须落"通过/不通过/灰色地带" + 具体价格区间。镜子测试:5 句话说不完整 = 不买。结构性逼出判断。
- 多视角对抗,不是单视角分析 — 四大师会产生真实的矛盾(拼多多:巴菲特说真便宜,李录说不确定就不买)。单一 prompt 制造不出这种冲突,而矛盾才是决策的真实状态。
- 结构化防骗 — AI 最危险的不是答错,是给一个"看起来很对但经不起推敲"的答案:
- 信息丰富度 A/B/C 评级:防止"资料多=确定性高"的幻觉
- 芒格式逆向检验:"什么情况下这家公司会死?"列 5 大情景
- 8 条一票否决红线:管理层诚信污点直接否决,不管多便宜
- 反共识检查:"聪明人为什么在做空?"
- 留白原则:数据不足标"灰色地带",不推测
- 金融数据精确性 — LLM 心算不可靠:PE 错一个小数点、市值单位混港币/人民币,就够做错决策。所有计算用 decimal.Decimal(不用 float),关键数据 ≥2 个独立来源交叉验证,>1% 差异标记,>5% 必须查原始财报。真实案例:腾讯市值有"港币亿"和"人民币亿"两种单位。
- 可复现流程 + 准出抽检 — 同输入 → 同结构输出。报告发布前随机抽 15% 数据点复核(report_audit.py),偏差 >1% 打回。
和我已有体系的关系
这套设计不是新东西——就是 multi-model-code-review 的投研版:对抗式多 agent + 结构化输出 + 内置校验工具。Hermes 的 delegate_task(batch 并行子 agent)就是 Claude Team API 的等价物,我移植时直接替换,方法论原样保留。
启发点:"强制结论"和"一票否决清单"可以移植到代码评审。评审意见如果只列"可以改进的地方"就是两面讨好;要求 reviewer 先给"通过/不通过/条件通过" + 一票否决项,才逼得出判断。
我的判断
- 实盘 2024 +69% / 2025 +66% 无法独立验证(富途截图),当营销看
- 方法论是扎实的,尤其"资料多 ≠ 确定性高"这条,对 AI 应用有普遍意义
- 工具链(financial_rigor.py 等)零依赖纯 stdlib,质量不错,可长期用