- CTGTの研究によると、DeepSeekやMoonshotのオープンソースモデルから蒸留(ディスティレーション)されたAIモデルは、元のモデルの政治的検閲メカニズムを必ずしも継承しないことが示された。
- ウイグル族の拘束キャンプについて尋ねた際、DeepSeekのモデルは証拠を否定したが、DeepSeekのデータを使用してCTGTが訓練したモデルは、拘束施設の証拠があることを認めた。
- この結果は、中国のオープンソースAIが北京の政治的見解を広めるという米国政府の大きな懸念の一つに疑問を投げかけている。
- CTGTは、大規模モデルが生成したデータを使用して小規模モデルを訓練する蒸留法を採用した。
- 研究者らはこれまで、学習過程を通じて検閲が新しいモデルに伝播すると仮定していたが、実験結果はそれを裏付けなかった。
- CTGTは、中国関連のトピックと対照質問を含む152組の質問を評価し、xAI、Google、OpenAI、Anthropicのモデルを使用して結果を採点した。
- この研究は1組のモデルのみを調査したものであり、検閲が継承されないメカニズムについてはまだ解明されていない。
- CTGTによると、多くの金融企業は検閲が分析結果を歪めることを懸念し、中国製AIの使用をためらっている。
- 報告書は、中国のAIモデルをカスタマイズまたは微調整することで、企業が低コスト・高性能という利点を活用できる可能性を示唆している。
- 著者はまた、検閲を排除できるのであれば他の安全メカニズムも排除される可能性があり、AIの悪用リスクが高まると指摘している。
- 一部の米当局者は中国製AIにバックドアが含まれている可能性を懸念しているが、記事によれば現時点で確実な証拠はない。
- この研究は、中国製AIを制限する政策を再評価する根拠となると同時に、結論を出す前にさらなる深掘りが必要であることを強調している。
📌 新しい研究は、中国のオープンソースAIモデルが微調整されたモデルに検閲メカニズムを自動的に伝播させるという見解に疑問を投げかけています。この結果は、企業や政策立案者の中国AIに対する見方を変える可能性があります。しかし、検閲の排除が容易になれば、他の安全策も無効化される恐れがあり、より厳格なAIガバナンスが求められます。

