- CTGT的研究显示,从DeepSeek或月之暗面(Moonshot)开源模型蒸馏出的AI模型不一定继承原模型的政治审查机制。
- 当被问及维吾尔族拘留营时,DeepSeek模型否认有证据,而CTGT利用DeepSeek数据训练出的模型则承认存在拘留设施的证据。
- 这一结果挑战了美国政府的一大担忧,即中国开源AI会传播北京的政治观点。
- CTGT使用蒸馏法,即利用大模型生成的数据来训练较小的模型。
- 研究人员此前假设审查会通过学习过程传递给新模型,但实验结果并未证实这一点。
- CTGT评估了152对问题,包括中国相关话题和对照问题,并使用xAI、谷歌、OpenAI和Anthropic的模型对结果进行评分。
- 该研究仅检查了一对模型,尚未解释审查不被继承的具体机制。
- CTGT表示,许多金融企业因担心审查会扭曲分析结果而对使用中国AI持迟疑态度。
- 报告认为,定制或微调中国AI模型可以帮助企业利用其低成本和高性能的优势。
- 作者还指出,如果可以消除审查,那么其他安全机制也可能被消除,从而增加AI滥用的风险。
- 一些美国官员担心中国AI可能含有安全后门,但文章称目前尚无确凿证据。
- 该研究被视为重新评估限制中国AI政策的基础,同时也强调在得出结论前需要进一步深入研究。
📌 这项新研究质疑了中国开源AI模型会自动将审查机制传递给微调模型的观点。结果可能改变企业和政策制定者对中国AI的看法。然而,研究也警告说,如果消除审查变得容易,其他安全屏障也可能失效,这需要更严格的AI治理机制。
