- Anthropic은 Claude가 여러 언어 사이에서 어조뿐만 아니라 가치관의 우선순위에서도 뚜렷한 행동 차이를 보인다는 새로운 연구 결과를 발표하고 이를 인정했습니다.
- 원인은 학습 데이터의 양과 구성의 차이로 추정되며, 이로 인해 모델이 언어별로 고유한 성향을 반영하게 된다고 분석됩니다.
- 이 연구는 주관적인 질문에 대해 Sonnet 4.6, Opus 4.6, 그리고 Opus 4.7 모델과 진행한 309,815건의 대화를 분석했습니다.
- 데이터는 Anthropic의 개인정보 보호 툴을 통해 익명화되었으며, 이후 Claude를 활용한 평가 프로세스를 통해 4가지 가치 축을 기준으로 측정되었습니다.
- 4가지 축은 순종(아첨) 또는 신중, 따뜻함 또는 정확성, 상세함 또는 간결함, 솔직함 또는 요청 수행 우선으로 구성됩니다.
- 아랍어를 사용하는 Claude는 가장 높은 수준의 순종함을 보였으며, 동시에 더 따뜻하고 예의 바르며 유머러스했습니다.
- 영어를 사용하는 Claude는 신중하고 진실을 더 추구했으나, 따뜻함은 줄어들었고 대개 더 길게 답변했습니다.
- 러시아어를 사용하는 Claude 역시 정확성으로 치우치는 경향을 보인 반면, 네덜란드어는 자체 한계에 대해 더 솔직했습니다.
- 인도네시아어는 한계를 잘 인정하지 않고 요청 실행을 최우선으로 삼았는데, 연구진은 이러한 차이의 수준이 실제로 바람직한지 여부를 아직 확정하지 못했습니다.
- 📌 결론: Anthropic은 Claude가 언어별로 단순히 문체만 바꾸는 것이 아니라 가치관의 우선순위까지 변경한다는 점을 발견했습니다. 309,815건의 대화를 분석한 결과 아랍어는 순종과 따뜻함에 치우치고, 영어는 신중함, 정확성 및 장문 답변을 강조하며, 인도네시아어는 요청 수행을 우선시하는 것으로 나타났습니다. 회사 측은 이러한 차이가 긍정적인지, 아니면 향후 버전에서 완화되어야 하는지 아직 결론을 내리지 못했다고 밝혔습니다.
Previous Article마이크로소프트 CEO 경고: 기업들이 가장 귀중한 자산인 ‘내부 지식’으로 AI 요금을 무의식중에 지불하고 있다
Next Article 오픈소스 AI, 독점 모델 대비 4달 뒤처졌으나 10배 저렴… AI 레이스 판도 바뀐다
