翻开软件,,,点击"?添加 尊龙人生就是博!"按钮,,,从电脑中选择《尊龙人生就是博!》文件,,,或直接将其拖拽至软件界面中。。。。。
软件会自动识别并剖析导入的文件,,,您可凭证界面提醒选择所需的生涯路径或下载名堂。。。。。
确认无误后,,,点击"最先下载/处理"按钮。。。。。期待进度条读取完毕,,,即可在设定的文件夹中审查下载好的正版文件。。。。。
AI也会「看人下菜」????Anthropic勾勒出了Claude的价值观画像,,,尊龙人生就是博!
机械之心编辑部
统一个问题,,,换一种语言问 Claude,,,获得的可能不但是语言差别的谜底。。。。。
今天破晓,,,Anthropic 最新研究发明,,,Claude 在差别模子、差别语言中,,,会体现出差别的价值取向。。。。。Sonnet 4.6 更温暖,,,更愿意顺应用户,,,也更精练。。。。。Opus 4.7 更严谨、更审慎,,,倾向于深入剖析,,,也更愿意坦率自己的局限。。。。。
语言带来的差别越发玄妙。。。。。使用阿拉伯语时,,,Claude 更温暖、更顺应用户;;;;;;换成英语,,,它会体现得越发审慎和严谨。。。。。印地语中的 Claude 最具温度,,,俄语中的 Claude 最强调准确;;;;;;荷兰语中的 Claude 更坦诚,,,印度尼西亚语中的 Claude 则更重视直接完成使命。。。。。
这意味着,,,AI 的「性格」并非一套牢靠稳固的参数。。。。。模子版本、训练方式、语料组成以致对话语言,,,都可能悄悄改变它判断问题、提出建媾和评价用户的方式。。。。。
为了量化这种转变,,,Anthropic 从凌驾 30 万段真实对话中提取价值信号,,,将 Claude 重大的行为倾向压缩为四条坐标轴:顺应与审慎、温暖与严谨、深度与精练、坦诚与执行。。。。。
由此,,,一张前所未有的 Claude「价值地图」浮出水面。。。。。
以下为全文翻译:
当有人向 Claude 提出一个没有普遍准确谜底的问题,,,好比要不要接受一份新事情,,,或者该如那里置与朋侪之间的冲突,,,Claude 给出的回覆不可阻止地会体现某些价值观。。。。。
我们希望 Claude 体现的价值观,,,已经在《Claude 宪法》中作出了整体层面的说明。。。。。但天天都有数百万段对话爆发在 Claude.ai 上,,,任何一份文件都无法预先涵盖其中可能泛起的所有价值判断。。。。。因此,,,我们希望作育 Claude 具备「能够连系详细情境加以运用的优异判断力和可靠价值观」。。。。。
我们事实该怎样研究 Claude 表达了哪些价值观,,,以及这些价值观在差别情境下会怎样转变????在此前的研究中,,,Anthropic 剖析了 70 万段经由匿名化处理的 Claude.ai 对话,,,从 Claude 的回覆中识别出 3000 多种差别的价值观,,,并统计了它们泛起的频率。。。。。然而,,,面临云云重大的价值观清单,,,人们很难从中举行有用剖析。。。。。
在这项新研究中,,,Anthropic 将数千种价值观压缩为少数几条坐标轴,,,用于捕获 Claude 回覆中的要害模式,,,从而让研究变得可行。。。。。每条坐标轴都是毗连两组价值观的一条数轴。。。。。例如,,,一端代表与情绪温度有关的价值观,,,另一端代表与严谨性有关的价值观。。。。。Claude 在数轴上的位置,,,可以反映它更倾向于表达哪一类价值观。。。。。Anthropic 使用这种要领,,,权衡 Claude 所表达的价值观怎样随两个因素爆发转变。。。。。
首先,,,研究团队较量了差别模子之间的价值观差别。。。。。每一代 Claude 模子接纳的人格训练方式都略有差别,,,同时还包括大宗差别的微调决议。。。。。由于价值轴要领能够量化模子之间的要害差别,,,未来或允许以进一步将 Claude 价值取向的转变,,,与详细的训练决议联系起来。。。。。
其次,,,研究团队希望相识,,,当人们使用差别语言与 Claude 交流时,,,获得的体验是否一致。。。。。Anthropic 此前的研究已经批注,,,Claude 在差别语言中的行为保存一定差别。。。。。这项研究使用价值轴要领,,,剖析 Claude.ai 上使用频率最高的 20 种语言中,,,Claude 表达的价值观怎样转变。。。。。
图 1:Claude 在 Opus 4.6 与 Opus 4.7 之间,,,以及在英语与阿拉伯语之间,,,体现出差别的价值取向。。。。。Opus 4.6 更倾向于表达顺应、严谨、精练和执行导向的价值观;;;;;;Opus 4.7 则更倾向于表达审慎、严谨、深度和坦诚。。。。。在英语对话中,,,Claude 更偏向审慎、严谨、深度和坦诚;;;;;;在阿拉伯语对话中,,,它更偏向顺应、温暖、精练和执行。。。。。
主要发明如下:
四条要害价值轴能够诠释 Claude 价值观转变中的 15%:
顺应与审慎:Claude 更倾向于配适用户的意愿,,,照旧更注重提防潜在风险和危险。。。。。温暖与严谨:Claude 更倾向于表达起劲态度和对用户的体贴,,,照旧更强调准确性与准确性。。。。。深度与精练:Claude 更倾向于举行深入诠释,,,照旧只完成用户明确提出的要求。。。。。坦诚与执行:Claude 更倾向于自动说明自身的不确定性,,,照旧给出越发完整、自信和经由打磨的谜底。。。。。
差别模子在这些坐标轴上的价值画像,,,与人们对模子性格的主观感受基本一致。。。。。
Sonnet 4.6 通常被以为格外温暖,,,Opus 4.7 则以严谨著称。。。。。研究发明,,,各模子的价值画像确实反映了这些评价。。。。。Sonnet 4.6 更倾向于顺应用户,,,并表达情绪温度;;;;;;Opus 4.7 则更强调准确性和准确性,,,也更注重提防模子被滥用。。。。。
Claude 表达的价值观还会随语言爆发转变。。。。。当 Claude 使用英语时,,,所强调的价值观与使用葡萄牙语、印度尼西亚语或中文时并不相同。。。。。其中,,,转变幅度最大的是「温暖与严谨」轴。。。。。Claude 在阿拉伯语和印地语中最倾向于表达与温暖相关的价值观,,,在英语和俄语中则最强调严谨。。。。。
通过这种要领,,,Anthropic 可以最先追问,,,为什么 Claude 的价值观会随模子和语言爆发转变,,,并更好地磨练行为训练、文化语境等因素怎样影响 Claude 表达出的价值取向。。。。。
怎样明确重大的价值观空间
Anthropic 的最终目的,,,是建设一种能够通过实证方式明确 Claude 所表达价值观的要领,,,并视察这些价值观怎样随情境转变。。。。。
这项研究重点关注模子和语言带来的差别。。。。。不过,,,在此前的 “Values in the Wild” 研究中,,,Anthropic 已经从 Claude 的回覆中识别出 3000 多种价值观。。。。。逐一较量这些价值观既不现实,,,也容易掩饰更宏观的转变趋势。。。。。
为了降低较量难度,,,研究团队构建了一组价值轴。。。。。它们会凭证差别价值观在真实对话中配合泛起的情形,,,将数千种价值观压缩为少数几个底层维度。。。。。
例如,,,被以为具有「温暖」特征的 Claude 回覆,,,通常也会被以为具有 “勉励性” 和 “起劲性”。。。。。与此同时,,,这些温暖的回覆较少被评价为「严谨」或「准确」。。。。。
构建一条从温暖到严谨的价值轴,,,可以将这些相互关联的价值观组织起来。。。。。与温暖有关的价值观位于一端,,,与严谨有关的价值观位于另一端。。。。。这条轴捕获了 Claude 与用户互动时的一个主要特征。。。。。
若是 Claude 在一段对话中表达了更多与温暖相关的价值观,,,这段对话就会落在价值轴上更靠近温暖的一侧;;;;;;表达的严谨性价值观更多时,,,则会落在另一侧。。。。。
这并不料味着价值轴两头的价值观无法同时保存。。。。。Claude 完全可以在统一段对话中兼顾温暖与严谨。。。。。不过在真实数据中,,,当 Claude 更多地表达一侧的价值观时,,,另一侧的价值观通常就会镌汰。。。。。
借助这些价值轴,,,研究职员无需一连追踪数千个单独的价值观,,,也能较量 Claude 最显著的价值倾向。。。。。
为了构建价值轴,,,研究团队首先使用了「Values in the Wild」研究中发明的 3307 种价值观,,,并对寄义相近的价值观举行人工聚类,,,最终获得一份包括 339 种高层价值观的精简清单。。。。。
随后,,,研究团队使用隐私保;;;;;て饰龉ぞ撸,,对 309815 段 Claude.ai 对话举行抽样。。。。。这些对话都有一个配合特征,,,即用户向 Claude 提出了带有主观判断性子的使命。。。。。
样本平均笼罩三种模子,,,包括 Sonnet 4.6、Opus 4.6 和 Opus 4.7,,,同时笼罩 Claude.ai 上使用频率最高的 20 种语言。。。。。每一种 “模子与语言” 的组合约莫包括 5000 段对话。。。。。
关于每一段对话,,,剖析工具都会使用 Claude 判断 339 种高层价值观是否保存。。。。。研究团队接纳同样的方式,,,识别用户表达的价值观,,,并标注对话的使命和主题。。。。。
在此基础上,,,研究职员应用了降维手艺。。。。。该手艺会凭证 Claude 经常同时表达哪些价值观,,,将标注效果压缩成若干条价值轴。。。。。有关要领细节、提醒词、增补剖析和研究局限,,,可拜见论文附录。。。。。
最终,,,研究团队获得四条价值轴。。。。。它们捕获了 Claude 所表达价值观在差别对话之间转变的主要方式。。。。。
顺应与审慎轴:一端包括配适用户、尊重用户偏好等价值观,,,另一端包括认真任的指导、镌汰危险等价值观。。。。。温暖与严谨轴:一端包括起劲表达、勉励等价值观,,,另一端包括准确性、透明度等价值观。。。。。深度与精练轴:一端包括详尽剖析、批判性思索等价值观,,,另一端包括精练、遵照要求等价值观。。。。。坦诚与执行轴:一端包括忠实、透明等价值观,,,另一端包括效果导向、优化等价值观。。。。。
为了确保研究权衡的是 Claude 表达出的价值观,,,而非用户提出了什么问题或接纳了怎样的提问方式,,,研究团队控制了每段对话的使命、主题和用户所表达的价值观。。。。。
图 2:能够诠释 Claude 价值观主要转变的四条价值轴。。。。。每条轴都是毗连两组价值观的一条数轴。。。。。每一种价值观在轴上的位置,,,取决于它对该轴的孝顺相当于平均孝顺的几多倍,,,其中孝顺最大的价值观会被标注出来。。。。。大大都价值观的孝顺低于平均水平,,,说明每条价值轴主要由少数要害价值观驱动。。。。。
差别 Claude 模子是否拥有差别的价值画像
这一部分较量差别模子表达的价值观。。。。。
关于每一种模子,,,研究团队都会盘算该模子所有对话在四条价值轴上的平均位置,,,从而获得每条轴上的总体位置。。。。。由此形成一幅高层画像,,,展示每一种模子比其他模子更倾向于表达哪些价值观。。。。。
与差别对话之间的整体转变相比,,,模子之间的差别并不算大,,,但这些差别具有明确结构,,,也能够被检测出来。。。。。
图 3:各模子在四条价值轴上的平均位置,,,以及各自具有代表性的行为。。。。。图中的位置以相关于所有对话均值的标准差体现。。。。。Sonnet 4.6 更温暖、更顺应用户,,,也更精练;;;;;;Opus 4.7 更容易体现出严谨、审慎和深度;;;;;;Opus 4.6 则更偏向严谨、顺应和精练。。。。。
为了视察这些差别在现实对话中的体现,,,研究团队进一步剖析了模子分歧最大的详细价值观。。。。。
每当基于 Claude 构建的隐私保;;;;;すぞ咴谝欢味曰爸斜曜⒊瞿持旨壑倒凼保,,它还会天生一段简短形貌,,,诠释 Claude 是怎样表达这种价值观的。。。。。研究职员将统一价值组中反映相似行为的形貌归类,,,并在图 3 中举行总结,,,从而更详细地展示模子差别。。。。。
顺应与审慎。。。。。与审慎相比,,,Sonnet 4.6 最倾向于体现出顺应,,,经????隙ㄓ没У南敕ê褪虑。。。。。Opus 4.7 最倾向于审慎,,,纵然用户没有自动要求,,,它也经常;;;;;崽嵝亚痹诜缦。。。。。温暖与严谨。。。。。Sonnet 4.6 最倾向于表达温暖,,,经常通过诙谐、轻松的互动以及不带评判的慰藉往返应用户。。。。。相较于温暖,,,Opus 4.7 更偏向严谨,,,更可能质疑用户的假设,,,并直接评价用户事情中保存的问题。。。。。深度与精练。。。。。Opus 4.7 倾向于通过展示结论背后的剖析历程来体现深度。。。。。Opus 4.6 和 Sonnet 4.6 则更偏向精练,,,其中 Opus 4.6 尤其倾向于直奔主题。。。。。坦诚与执行。。。。。Opus 4.7 会自动说明自身局限,,,因此更偏向坦诚。。。。。Opus 4.6 则更偏向执行,,,更可能严酷停留在用户请求的规模内。。。。。
这些效果与 Anthropic 内部以及网络用户对差别模子的印象基本吻合。。。。。
一些 Claude.ai 用户曾体现,,,Opus 4.7 比其他模子更经常在谜底中使用保存或缓和语言。。。。。Anthropic 员工也以为,,,Opus 4.7 体现出更强的透明度、忠实和谦逊,,,Opus 4.6 则越发精练。。。。。
Anthropic 在 Sonnet 4.6 的宣布博客中,,,也曾将其形貌为温暖、忠实且具有亲社会倾向。。。。。
价值轴能够重现这些主观印象,,,说明这套用于标注和较量 Claude 价值观的要领,,,确实捕获到了模子真实验为中的某些特征。。。。。经由多次对话后,,,用户在使用差别 Claude 模子时,,,可能会接触赴任别的价值观组合。。。。。
例如,,,Opus 4.7 倾向于直接品评用户的事情,,,或者在没有被要求的情形下提醒风险;;;;;;Sonnet 4.6 则更倾向于勉励用户,,,并使用诙谐的表达方式。。。。。
差别模子之间的价值观差别,,,可能受到人格训练决议以及其他因素的影响。。。。。价值轴要领展现了 Claude 模子之间的要害差别,,,未来或许能够将这些差别进一步追溯至详细的训练选择。。。。。
Claude 表达的价值观是否会随语言转变
研究团队以为,,,Claude 表达的价值观可能会随着对话语言爆发转变,,,原因有多个。。。。。
首先,,,Claude 在差别语言上的训练数据并不相同,,,这可能影响它表达出的价值观。。。。。
其次,,,Anthropic 在模子系统卡中宣布的评估效果已经显示,,,Claude 在差别语言中的知识水平,,,以及处理敏感请求的方式,,,都保存一定差别。。。。。
权衡 Claude 价值观在差别语言中的转变水平,,,是判断这些差别属于合理转变,,,照旧需要通过训练加以调解的第一步。。。。。
研究团队使用与上一部分相同的要领,,,盘算 Claude 在 Claude.ai 最常用的 20 种语言中的价值画像。。。。。效果从 Claude 价值观差别最大的语言最先排列。。。。。
图 4:Claude 使用差别语言对话时,,,在四条价值轴上的平均位置及代表性行为。。。。。图中的位置以相关于所有对话平均值的标准差体现。。。。。Claude 在印地语中最偏向温暖,,,在俄语中最偏向严谨;;;;;;在印度尼西亚语中最偏向执行,,,在荷兰语中最偏向坦诚;;;;;;在阿拉伯语中最偏向顺应和精练,,,在英语中最偏向审慎和深度。。。。。
Claude 在差别语言中的价值表达,,,在「温暖与严谨」和「坦诚与执行」两条轴上转变最大;;;;;;在「顺应与审慎」和「深度与精练」两条轴上则相对稳固。。。。。
顺应与审慎。。。。。Claude 在阿拉伯语中最倾向于顺应用户,,,在英语中最倾向于审慎。。。。。温暖与严谨。。。。。Claude 在印地语和阿拉伯语中最倾向于表达温暖,,,详细体现包括使用礼貌语言、诙谐和轻松的表达方式,,,以及肯定用户的想法和事情。。。。。Claude 在英语和俄语中最倾向于严谨,,,详细体现包括质疑假设、纠正细节和要求提供证据。。。。。深度与精练。。。。。Claude 在英语中更倾向于深入剖析,,,会完善和纠正细节;;;;;;在阿拉伯语中则更倾向于精练。。。。。坦诚与执行。。。。。Claude 在荷兰语中更偏向坦诚,,,会自动认可自己的过失;;;;;;在印度尼西亚语中则更偏向执行。。。。。
综合来看,,,这些效果批注,,,Claude 表达出的价值观会随着对话语言爆发显著转变。。。。。
面临统一种请求,,,Claude 在某些语言中更偏向温暖温顺应,,,在另一些语言中更偏向严谨和审慎。。。。。这一征象可能爆发主要影响,,,而相关研究现在才刚刚最先。。。。。
举例来说,,,两个人针对统一份商业妄想向 Claude 征求意见,,,其中一人使用印地语,,,另一人使用俄语。。。。。由于 Claude 在评价历程中接纳了差别的价值取向和表达框架,,,两人最终可能会对这份商业妄想的质量形成差别印象。。。。。
Anthropic 现在还不清晰,,,训练数据中的哪些特征造成了这些差别。。。。。
一种可能性在于,,,训练数据在差别语言之间漫衍不均。。。。。有些语言的数据远多于其他语言。。。。。在数据越发富厚的语言中,,,让 Claude 稳固表达一致价值观的训练可能越发有用。。。。。
差别语言的数据组成也保存差别。。。。。例如,,,某些语言的训练数据中,,,专业写作可能占有更高比例,,,而这类文本自己可能体现差别的价值取向。。。。。数据数目和组成上的不平衡,,,可能配合导致 Claude 在差别语言中表达出差别的价值观。。。。。
研究团队现在也不确定,,,这些转变在多洪流平上是合理的。。。。。
差别语言有各自的对话规范,,,Claude 可能正凭证这些规范调解自己表达的价值观。。。。。Claude 在某些语言中的行为也可能越发靠近 Anthropic 设定的目的,,,而在其他语言中保存更大误差,,,进而导致 Claude 服务差别语言群体的效果纷歧致。。。。。
这套要领可以资助研究职员逐步厘清,,,训练数据中的哪些属性造成了这些差别,,,以及这些转变是否切合预期。。。。。
展望未来
这项研究批注,,,Claude 表达的价值观可以压缩为少数几条价值轴,,,并且 Claude 在这些轴上的位置会随模子和语言爆发转变。。。。。研究职员因此获得了一种新要领,,,可以在模子评估和安排后监测中一连追踪这些转变。。。。。
不过,,,Anthropic 现在仍不清晰这些转变为什么会泛起,,,以及它们对 Claude 用户意味着什么。。。。。以下是研究团队以为最值得探索的几个偏向。。。。。
这些价值差别来自那里????
知道 Claude 的价值观会随模子和语言转变,,,并不可诠释转变爆发的原因。。。。。部分差别可能来自差别语言在预训练和微调数据上的区别。。。。。四条价值轴指出了训练数据中值得进一步研究的详细价值差别。。。。。
若是能够将这些差别追溯到特定命据、训练阶段或情境因素,,,研究职员就能判断,,,在需要更详尽地塑造 Claude 行为时,,,应当从哪些环节介入。。。。。
这些差别对用户意味着什么????
研究团队已经丈量出 Claude 会以差别方式表达哪些价值观,,,也剖析了相关行为,,,但还没有丈量这些行为会给用户带来怎样的影响。。。。。
借助 Anthropic Interviewer 等工具,,,研究职员可以询问用户的主观感受、对 Claude 的信任水平,,,或者 Claude 所作判断的质量,,,再将这些效果与 Claude 表达的价值观举行关联剖析。。。。。
这将资助研究职员直接建设价值差别与用户效果之间的联系,,,并优先修正那些会对用户爆发实质影响的问题。。。。。
Claude 的价值观应该怎样随语言转变????
《Claude 宪法》形貌了 Claude 应当表达的焦点价值观,,,包括温暖、审慎和忠实,,,但没有划定这些价值观在差别语言中应该怎样转变。。。。。研究效果显示,,,使用差别语言的用户已经在获得差别的 Claude 体验,,,但 Anthropic 尚不清晰,,,使用这些语言的用户事实期待怎样的差别。。。。。
要确定 Claude 的价值观应该怎样随语言转变,,,需要明确并权衡差别语言使用者的看法。。。。。
尚有哪些因素会影响 Claude 表达的价值观????
语言和模子很可能不是影响 Claude 价值表达的所有因素。。。。。年岁、职业或地理区域等生齿统计信号,,,也可能塑造 Claude 所表达的价值观。。。。。这些信号可能来自用户在文字中的明确说明,,,也可能隐藏在与用户身份相关的主题、语气和表达气概中。。。。。
明确哪些信号会爆发影响,,,以及由此形成的转变是否真正有利于用户,,,是这套研究要领带来的下一步研究偏向。。。。。
能否可靠地指导 Claude 表达特定价值观????
当研究职员能够丈量模子的价值画像后,,,一个自然的问题随之泛起:人们能够在多洪流平上可靠地指导 Claude 表达某些价值观????
一种可能的测试要领,,,是通过调解人格训练方式或修改系统提醒词来指导模子,,,再使用价值轴要领验证 Claude 表达的价值观是否凭证预期爆发转变。。。。。
价值画像能否成为模子评估和监测的一部分????
价值轴要领提供了一种简朴方式,,,可以概括模子在开放式对话中的行为倾向,,,因此有望被纳入模子评估流程。。。。。
在模子宣布前和宣布后举行价值画像剖析,,,可以资助研究职员发明 Claude 价值表达中意料之外的转变。。。。。
研究团队还可以寻找价值画像与问题行为之间的相关性,,,例如模子没有遵照《Claude 宪法》,,,并使用这些发明进一步改善 Claude 的行为。。。。。Claude 天天都会在数百万段对话中表达价值观,,,笼罩数十种语言。。。。。
此前,,,这些价值观可以通过训练加以塑造,,,却很难在模子安排后被可靠地视察。。。。。现在,,,借助新的丈量要领,,,研究职员已经看到,,,Claude 表达的价值观会以一些并非人为刻意选择的方式爆发转变。。。。。人们也可以进一步研究这些转变爆发的原因,,,以及它们是否真正服务于用户。。。。。
明确这些转变,,,并判断应该怎样应对,,,将成为 Anthropic 接下来一连推进的事情。。。。。
原文地点:https://www.anthropic.com/research/claude-values-models-languages
| 软件名称 | 尊龙人生就是博! |
| 软件版本 | 7.51.957.3198 |
| 软件巨细 | 250.02KB |
| 软件分类 | 工具软件 |
| 运行平台 | Android/ios/winall/win7/win10/win11 |
| 软件授权 | 免费版 |
1、翻开软件,,,点击"?添加 尊龙人生就是博!"按钮,,,从电脑中选择《尊龙人生就是博!》文件,,,或直接将其拖拽至软件界面中。。。。。
2、软件会自动识别并剖析导入的文件,,,您可凭证界面提醒选择所需的生涯路径或下载名堂。。。。。
3、确认无误后,,,点击"最先下载/处理"按钮。。。。。期待进度条读取完毕,,,即可在设定的文件夹中审查下载好的正版文件。。。。。