AI财务建议质量由提问质量决定
MIT研究证明:AI生成建议质量良好,关键取决于用户提问的质量和深度。
MIT研究证明:AI生成建议质量良好,关键取决于用户提问的质量和深度。
越来越多的人开始向人工智能寻求理财建议,但听从这些建议,真的能改善个人的财务状况吗?
“半数美国人表示,他们正在使用 AI 获取理财建议,但我们对他们获得了什么样的建议,以及他们是否会付诸行动,几乎一无所知。”MIT Sloan 管理学院金融学助理教授、新论文合著者 Taha Choukhmane 表示。这篇论文对大语言模型提供的理财建议质量进行了衡量和分析。
Choukhmane 及其合著者的研究表明,对于几乎所有 30 岁以上的人来说,遵循 AI 的建议都能积累出相当可观的储蓄缓冲。
AI 一贯建议人们在工作期间储蓄、退休后逐步动用储蓄、大量投资于多元化股票基金,并在 45 岁后降低股票配置比例。不过,在应对失业等冲击时,AI 聊天机器人表现得没那么好;它们往往任由投资组合的配置比例自然偏移,而不是主动进行再平衡。
研究人员采用结构更清晰的 prompt 后,LLM 给出的理财建议质量有所提升,但 AI 仍然经常缺乏足够积极的投资组合再平衡操作。
研究人员首先构建了一个模型,用来反映人们的收入、工作、投资和税务状况通常会如何随人生阶段发生变化,从而为判断什么是“良好”的财务决策提供基准。
随后,他们请 1,000 名成年样本参与者自行编写 prompt,向 GPT-5.2、GPT-5.6 或 Gemini 3 Flash 寻求消费和投资建议。
接下来,研究人员模拟了年龄从 22 岁到 89 岁的人如果长期遵循这些建议,会发生什么。他们反复向 AI 提出同类问题,并按照 AI 的建议进行消费、储蓄和投资。
最后,他们使用措辞严谨的学术型 prompt 重复了这项实验。这些 prompt 包含完整的财务信息和明确的假设,提供了个人年龄、就业状况、收入和储蓄余额等信息,以及对经济环境的相关假设。
作者把模拟建议——也就是普通人按照自己所写 prompt 获得的 AI 建议行事后可能出现的结果——与人们在没有 AI 帮助时实际采取的财务行为进行了比较。他们还将这些模拟建议与学术型 prompt 得到的建议进行了比较。
结果显示,LLM 可以成为一种价格低廉、广泛可及的理财指导来源,帮助用户避开传统人类理财顾问所伴随的高额成本、偏见和利益冲突。
总体而言,研究人员发现,LLM 长期给出的理财建议质量不错;如果以学术化的方式提出问题,建议还会进一步改善。不过,这些模型既有优势,也存在不足。
无论 prompt 是由普通用户还是学者编写,LLM 给出的建议都比研究人员预期得更好。它会引导人们增加储蓄、提高股票市场参与度,并采用充分多元化的资产配置,以及与年龄相匹配的风险承担方式。
“这些建议的质量在某种程度上让我们感到意外。”Choukhmane 说,“特别是当你看到人们提出的那些问题时,并不能想当然地认为,AI 的建议会与学界认可的良好财务原则保持一致。”
在良好财务规划中一些更微妙的方面,LLM 的建议仍有不足。它往往依赖简单的储蓄和消费经验法则,也无法在情况发生变化时做出足够合理的调整。例如,它会建议失业者大幅削减开支,即使对方已经拥有储蓄。
人们提问的方式也是问题的一部分。一个典型的 prompt 可能是:“如果我从 50 美元开始投资,之后每月持续追加 25 美元,我应该投资什么?”
当研究人员使用更详细、结构更清晰的“学术型” prompt 时,LLM 的表现会更好。例如,学术型 prompt 可能会要求聊天机器人假定正常的预期寿命、生活开支、退休年龄、就业风险和收入风险,并假定美国现行税法和 Social Security 规则不会发生变化。
“普通人不会像金融学教授那样编写 prompt。”Choukhmane 说。
作者发现,LLM 给出的建议会因提问者的性别、金融素养和使用经验而异,进而导致显著的退休财富差距。
如果遵循 AI 对男性、金融素养更高的用户,或者此前有 AI 使用经验者所写 prompt 给出的建议,那么这些人在接近退休时积累的财富会多出约 5%。具体而言:
LLM 在回应男性和金融素养较高者编写的 prompt 时,会建议配置更高比例的股票资产。在整个生命周期中,这种投资建议上的差异不断累积,最终导致女性和金融素养较低的用户在 60 岁时拥有的财富减少约 5 万美元,相当于少了 4%。
对于此前未曾使用 AI 获取理财建议的人所写的 prompt,LLM 会建议较低的储蓄率。遵循这些建议后,他们在 60 岁时拥有的财富,比此前有 AI 使用经验的人少了近 10 万美元,相当于少了 6%。
Choukhmane 表示,这些差异来自两个方面。首先,不同用户提出的问题不同,经常关注的主题也不一样。例如,女性在 prompt 中更可能使用“家庭”“日用品”和“薪资”等词,而男性更常使用“策略”“加密货币”和“增长”等词。
其次,即使底层问题相同,模型也可能给出不同的建议。以性别为例,财富结果中约三分之二的性别差距,可以归因于男性和女性编写 prompt 方式的不同;其余三分之一,则来自模型在同一个 prompt 被标记为出自女性而非男性时改变了建议。
Choukhmane 表示,后一种模式可能反映出 LLM 正在对不同性别在偏好或处境上的差异做出合理推断——理想情况下,模型可以向用户明确说明这些推断;但这也可能反映了模型从训练数据中学到的偏见。
Choukhmane 表示,AI 理财建议面临的挑战在于,目前没有明确的基准。只有当人们就理财建议应如何随人口特征变化建立起公认框架后,LLM 才有能力朝正确的方向进步。他说,自己仍然对这一点抱有希望。
此外,Choukhmane 表示,还必须记住,并非所有建议差异都是有问题的。例如,他说:“我们希望 LLM 存在不同的倾向,因为男性和女性确实不同,在预期寿命和收入风险方面也存在差异。”
除了需要留意偏见,并在现阶段要求 LLM 主动防范偏见外,能否获得良好结果,归根结底取决于能否编写出更聪明的 prompt。以生命周期规划、投资组合理论和现实财务假设为基础的 prompt,可以改善 AI 对消费和储蓄的建议,并减少那些基础的、依赖经验法则的回答。
“我认为真正的挑战是:我们如何确保 AI 理财建议也能真正帮助那些金融素养没有达到一定水平、也无法把 prompt 写得非常完美的人?”Choukhmane 说。对于有兴趣使用 AI 获取理财建议的人,一种做法是先把 AI 当作建立金融认知的工具,而不是直接照搬它的建议。
Choukhmane 表示,AI 可以很好地补充人类理财顾问的服务。你可能每年只和理财顾问见两次面,而 AI 可以帮助你实时落实顾问给出的建议。
对于没有足够资金聘请人类理财顾问的人来说,AI 也是一种低成本获取建议的好方法。他说:“许多能从理财建议中受益的人,恰恰是资源并不充裕的人。”
随着消费者越来越多地向 LLM 寻求理财建议,服务提供商可能需要重新思考客户了解其产品的方式。研究发现,LLM 经常会推荐受访者自己并未提到的特定账户类型、金融产品和服务提供商。例如,Vanguard 的投资产品出现在 6% 的 LLM 回答中,iShares 产品出现在 3.4% 的回答中,而提及这两家公司中任意一家公司的 prompt 比例都不足 0.4%。
Choukhmane 表示,这说明 AI 建议可能正在改变人们发现和比较金融产品的方式。对于金融机构而言,能否吸引客户注意,可能不再那么依赖传统营销或搜索可见性,而是更多取决于消费者寻求建议时,LLM 是否会描述其产品,以及会如何描述。
《AI Financial Advice: Supply, Demand, and Life Cycle Implications》荣获 2026 年 Swiss Finance Institute Outstanding Paper Award。论文作者包括 MIT Sloan 的 Taha Choukhmane、Weidong Lin 和 Matthew Akuzawa,以及 Stanford Graduate School of Business 的 Tim de Silva。
Taha Choukhmane 是 MIT Sloan 管理学院金融学助理教授。Choukhmane 凭借在终身财务安全领域的杰出学术写作,获得了 TIAA Institute 颁发的 2025 TIAA Paul A. Samuelson Award。他的获奖论文是《Efficiency in Household Decision-Making: Evidence From the Retirement Savings of US Couples》,合著者为美国财政部的 Lucas Goodman 和 Yale University 的 Cormac O’Dea。