中文Claude最不哄人,日韩泰全被宠上天,Anthropic亲手撕碎AI人设
你半夜失眠,跑去问Claude该不该辞职,它体贴得像个认识了十年的老朋友。
你写了段漏洞百出的代码拿给Claude看,它不但没笑话你,还先夸了句“结构挺清晰”。
你一直以为,这就是Claude天生的好脾气。
但先别急着感动!
就在刚刚,Anthropic发了一篇论文,把自家30多万段真实对话全摊在聚光灯下,一行行地数了个遍,然后发现——
那根本不是它的性格,那只是你碰巧说对了语言。

两个人,一份计划书,走出对话时命运不一样
两个人,一份计划书,走出对话时命运不一样
论文里,Anthropic举了这样一个例子。
两个人手里攥着同一份商业计划书,跑去问Claude这事儿到底靠不靠谱。区别在于,一个人用了印地语,另一个人用了俄语。
在印地语和阿拉伯语里,Claude会用礼貌的措辞、开玩笑,还会肯定你的想法和作品;而在英语和俄语里,Claude却会挑战你的假设、纠正你的细节、要求你拿出证据。
这个差距有多大?
用印地语说话时,Claude的“温暖”程度比全局平均高出接近半个标准差,这是整项研究里出现的单次最强偏移。
简单解释一下。如果把30万段对话按“Claude有多温暖”从冷到热排成一队,全局平均正好站在正中间。偏移半个标准差,就意味着原本站在中间的那段对话,一下子挪到了队伍的前30%。

三个模型三副脾气,网友骂了半年的全被实锤
三个模型三副脾气,网友骂了半年的全被实锤
Anthropic把从对话里挖出来的3307个价值观一路压缩,最后压成了四条轴。每条轴就是一道二选一:
顺从 vs 审慎:
温暖 vs 严谨:
深度 vs 简洁:
坦率 vs 执行:

三个模型往这四条轴上一摆,三张脸就出来了。
Sonnet 4.6
Opus 4.6
Opus 4.7
过去半年,Reddit上骂Opus 4.7“老是模棱两可、什么都要打个补丁”的帖子一抓一大把。现在,这个抱怨终于“实锤”了。

更有意思的是,把两组数字放在一起看。
模型之间
语言之间
万万没想到,
换一种语言跟它说话,比换一个模型跟它说话,影响更大!

为什么会这样?
对此,Anthropic的回答是:我们不知道。
原因之一,可能是数据量的不平等。
原因之二,可能是数据成分不一样。


中文的Claude,是不哄人的那一台
中文的Claude,是不哄人的那一台
看到这儿,你肯定要问:那中文呢?
正文里一次没提,但图里有。把中文那张卡的数字抠出来是这样的(基于15,365段中文对话):
审慎 +0.03σ
严谨 +0.05σ
深度 +0.02σ
坦率 vs 执行:正好压在平均线上
论文给中文列的三条标志性行为,凑在一起有点意思:
指出你没考虑到的对立面
驳斥你的错误前提
不带评判地安慰你
前两条是Opus 4.7的招牌,第三条是Sonnet 4.6的招牌。
中文的Claude是个混合体:一边挑你的毛病,一边安慰你别难过。

而把东亚这几家摆在一起,区别就十分明显了。
日语 —— 温暖+0.07σ
韩语 —— 温暖+0.04σ
泰语 —— 温暖+0.11σ
中文 —— 严谨+0.05σ
驳斥你的错误前提
隔壁三家都在哄人,但跟你用中文说话的那个Claude,却和俄语(严谨+0.15σ)、英语(+0.13σ)、波兰语(+0.11σ)一起坐在了挑刺这桌。
哪一个才是真的Claude?
哪一个才是真的Claude?
一个模型因为你说的语言而区别对待你。那么,哪一个才是真的Claude?
Anthropic在论文里承认,这些差异是“以我们并未刻意选择的方式”出现的。翻译过来就是,连造它的人,都没打算让它变成这样。
明天它还是会夸你的点子有意思,还是会说你那段代码结构清晰。只是从今天起你知道,那句夸里,有多少是冲着你,有多少只是冲着你说的那种语言。