- Anthropicは新たな研究を公表し、Claudeが複数の言語間で、口調だけでなく価値観の優先順位においても明確な行動の違いを示していることを認めました。
- 原因は、訓練データの量と構成の違いにあるとされており、これによりモデルが言語ごとに固有の傾向を反映するようになります。
- この研究では、主観的な質問に対する Sonnet 4.6、Opus 4.6、および Opus 4.7 モデルとの 309,815 件の会話を分析しました。
- データは Anthropic のプライバシー保護ツールを使用して匿名化され、その後、Claude を活用したプロセスを通じて 4 つの価値観の軸で評価されました。
- 4つの軸とは、従順(世辞)または慎重、温かみまたは正確さ、詳細または簡潔、率直または要求達成の優先、です。
- アラビア語を使用する Claude は、最も高い従順さのレベルを示し、また、より温かく、礼儀正しく、ユーモアがありました。
- 英語を使用する Claude は慎重で、より真実を追求する傾向がありましたが、温かみは減少し、通常は回答が長くなりました。
- ロシア語を使用する Claude も正確さを重視する傾向があり、オランダ語は自分自身の限界についてより率直でした。
- インドネシア語は限界をあまり認めず、要求の実行を優先していましたが、研究者たちはこの違いのレベルが実際に望ましいものであるかどうかをまだ特定していません。
- 📌 結論: Anthropicは、Claudeが言語ごとにスタイルを変えるだけでなく、価値観の優先順位をも変更していることを発見しました。309,815件の会話を分析した結果、アラビア語は従順さと温かみに傾き、英語は慎重さ、正確さ、そして長い回答を重視し、インドネシア語は要求の実行を優先することが分かりました。同社は、これらの違いが肯定的なものなのか、あるいは将来のバージョンで軽減されるべきものなのかについて、まだ結論を出していないと述べています。
Previous ArticleマイクロソフトCEOが警告:企業は最も貴重な資産である「内部知」を無意識のうちにAIへの対価として支払っている
Next Article オープンソースAIはわずか4ヶ月遅れだが10倍安い、AIレースの潮流が変わりつつある
