- 주요 AI 대형 언어 모델(LLM)은 영어 이외의 언어, 특히 데이터가 부족한 저자원 언어에서 성능이 저하되는 경향을 보임.
- 글로벌 노스(Global North) 중심의 기술 개발로 인해 비영어권 사용자들이 디지털 경제에서 소외되는 현상이 심화됨.
- 잘못된 학습 데이터와 기계 번역 오류로 인해 오히려 왜곡된 정보가 재생산되는 부작용이 발생함.
기술적 격차와 디지털 소외
- 스탠포드 HAI의 2025년 보고서에 따르면, 구글이나 메타 등 주요 기업의 LLM은 저자원 언어 사용자의 요구를 충족하지 못함.
- 쿠르드어, 스와힐리어 등 특정 언어 사용자는 대형 기술 기업의 우선순위에서 밀려나 신뢰할 수 없는 도구를 사용해야 함.
- 타밀어로 이메일 작성을 요청할 경우 영어로 된 오류투성이 초안이 생성되는 등 실제 업무 활용도가 매우 낮음.
문화적 편향과 데이터 품질 문제
- AI 모델이 생성하는 결과물은 서구의 가치관과 규범을 반영하며, 비영어권의 다양한 문화적 관점을 소외시킴.
- 저자원 언어 데이터 확충을 위한 무분별한 웹 크롤링은 기계 번역 오류가 포함된 저품질 데이터를 AI에 학습시키는 역효과를 초래함.
- 검증되지 않은 데이터가 AI 학습에 활용되면서 오류가 누적되고, 결과적으로 해당 언어 공동체의 정보 신뢰도를 하락시킴.
해결 방안
- 기술 기업들은 개발 단계부터 저자원 언어 사용자와의 협력적 파트너십을 구축해야 함.
- 단순히 데이터 양을 늘리는 것이 아니라, 커뮤니티의 검토를 거친 정확하고 진정성 있는 데이터를 통합하는 과정이 필수적임.
- 풀뿌리 AI 리더들과 협력하여 현지 요구사항에 특화된 기술을 개발함으로써 기술의 혜택이 소수뿐만 아니라 다수에게 돌아가도록 해야 함.
이 요약은 AI가 원문 기사를 바탕으로 생성했으며, 일부 뉘앙스나 이후 업데이트가 생략될 수 있어요. everytldr 소개