← 資訊首页 | 货源大厅

条件一变,AI还像你吗?MIT实测数字分身的边界

2026-10-11 · 来源:{'name': '虎嗅·中继', 'url': 'https://www.huxiu.com/article/4896590.html'}

条件一变,AI还像你吗?MIT实测数字分身的边界

54人访谈、1742项评测:AI记住了你的立场,却未必算准你的权衡

如果一项全民医疗新方案每年能为你的家庭省下3000美元,同时允许保留私人保险,你还会坚持原来的立场吗?麻省理工等机构的研究者用这类问题测试了大模型的极限:他们提出的HugAgent,先让AI通过访谈了解一个真实的人,再预测此人在从未被问过的新情境下会如何作答。该论文已入选EMNLP 2026 Main Oral。

研究没有从公开人物资料或网络文本出发,而是重新招募了54名真实参与者。议题选在全民医疗、公共监控与住房增密上——三者在美国分歧明显,且都涉及真实的价值取舍。团队据此构建了1,742个评测项,横评GPT、Claude、Gemini、DeepSeek、Llama、Qwen等模型。

结论的一半在意料之中:个人访谈确实能让模型更准确地模拟一个具体的人。另一半则值得警惕。

聊得越久,AI越清楚此人此刻怎么想,却不一定更知道条件改变后他会怎么回答。这正是'描述一个人'与'预测一个人'之间的鸿沟:模型可以记住'他支持全民医疗,同时担心成本、效率和个人选择',但要判断他真正看重什么、在条件变化后如何重新权衡,单纯堆叠访谈时长并不奏效。

这道题的分量正在上升。从虚拟用户、合成受访者到个性化AI Agent,先访谈建档、再让大模型扮演本人的路线日益流行,而HugAgent把一个更基础的问题摆上台面:AI建立的究竟是一个关于你的模型,还是只是一份越来越详细的个人画像?论文已上传arXiv(2510.15144),代码与项目主页同步公开。

主题标签: HugAgent · MIT · Claude · Gemini · DeepSeek · Digital Twin


相关阅读


萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅