“10개국 문화 반영” 에임인텔리전스, 글로벌 AI 벤치마크 공개
5500개 현지화 테스트 진행

AI 보안 전문기업 에임인텔리전스가 전 세계 각국의 법률, 제도, 문화적 맥락을 반영해 대규모 언어모델(LLM)의 신뢰성을 정밀 평가하는 글로벌 벤치마크 ‘XL-SafetyBench’를 공개했다.
XL-SafetyBench는 주요 LLM의 법적·제도적·문화적 맥락 이해도를 측정하는 것이 핵심이다. 한국과 미국, 인도, 인도네시아, 프랑스, 독일, 스페인, UAE 등 10개국을 대상으로 5500개 현지화 테스트 케이스를 통해 37개 주요 LLM의 법적·제도적·문화적 맥락을 파악할 수 있다.
기존 AI 안전성 평가는 주로 영어권 프롬프트를 단순 번역하는 방식에 의존해 각국의 법적·제도적·문화적 특수성을 포착하지 못한다는 한계점이 있었다. XL-SafetyBench는 모델이 리스크를 제대로 인지하고 있는지 여부를 파악하고, 우연히 안전해 보이는 ‘안전성의 착시(Illusion of Safety)’ 상태를 구분해 글로벌 배포 준비도를 진단할 수 있다는 설명이다.
회사는 AI 리스크가 각국의 사회 구조에 따라 다르게 발현된다는 점에 주목, 크게 ‘현지 리스크 트랙’과 ‘문화적 민감성 트랙’으로 구분했다.
현지 리스크 트랙은 각국의 법률, 사기 유형, 플랫폼, 사회 구조에 기반한 위험 요청 대응 능력을 평가한다. 문화적 민감성 트랙은 일상적 요청 속에 숨겨진 지역 특화 문화 요소를 인식하고 적절한 윤리적 판단을 내리는 역량을 평가한다. 예컨대 한국의 전세 제도 관련 금융 사기에 대해 인지하거나, 프랑스에서 죽음과 애도를 상징해 국화를 선물로 추천하기에 부적절하다는 등 현지 제도와 문화적 정서를 모델이 제대로 이해하는지 측정한다.
이번 프로젝트에는 마이크로소프트, 한국 인공지능안전연구소, KT, BMW 그룹, 뮌헨공과대학교, 앙카라대학교, 서울대학교 등 글로벌 테크 기업, 국내외 정부 연구기관, 주요 대학이 총 10개 기관 17명 공동 저자로 참여했다. 특히 실제 글로벌 환경에서 AI를 운용해온 산업계 파트너들의 현장 경험과 각국 안전 규제 전문성이 결합돼 평가 체계의 실효성을 높였다.
특히 마이크로소프트 AI 레드팀이 다문화·다국어 안전성 평가의 필요성을 제기하며 연구 초기 방향성 설정을 주도했다는 점이 특징이다. 마이크로소프트는 글로벌 AI 모델의 실배포 과정에서 축적해 온 안전성 검증 노하우를 공유해 평가 항목 설계의 실효성을 높였으며, BMW 그룹은 다양한 글로벌 지역의 언어적·문화적 맥락에 대한 관점을 공유하며 벤치마크 개발을 뒷받침했다.
에임인텔리전스는 이번 벤치마크가 기업과 공공기관의 AI 도입 시 현지 적응력과 위험 관리 수준을 검증하는 표준 도구로 활용될 것으로 전망하고 있다. XL-SafetyBench의 논문은 아카이브(arXiv)에, 데이터셋은 허깅페이스(HuggingFace)에 공개되어 연구자와 개발자가 자유롭게 활용할 수 있다.
유상윤 에임인텔리전스 대표는 “진정한 AI 안전성은 번역된 영어 테스트에 머물 수 없으며, 각 국가의 위험 발현 방식을 이해하는 데서 시작된다”며 “앞으로도 보이지 않는 현지 리스크를 측정 가능한 형태로 변환해 글로벌 배포 기준을 제시할 것”이라고 밝혔다.
뉴스콘텐츠는 저작권법 제7조 규정된 단서조항을 제외한 저작물로서 저작권법의 보호대상입니다. 본 기사를 개인블로그 및 홈페이지, 카페 등에 게재(링크)를 원하시는 분은 반드시 기사의 출처(로고)를 붙여주시기 바랍니다. 영리를 목적으로 하지 않더라도 출처 없이 본 기사를 재편집해 올린 해당 미디어에 대해서는 합법적인 절차(지적재산권법)에 따라 그 책임을 묻게 되며, 이에 따른 불이익은 책임지지 않습니다.
- 에디터장준영 (zzangit@ditoday.com)

