“어떤 모델 도입해야?” CFO 위한 오픈AI의 조언
‘달러당 유용한 지능’으로 평가해야

수많은 AI 모델 중 어떤 게 최고의 효율을 낼까? 많은 최고재무책임자(CFO)가 품고 있는 이 질문에 오픈AI가 한 가지 방법을 제시했다. ‘달러당 유용한 지능(Useful Intelligence per Dollar)’을 측정하라는 것이다.
일반적으로 기업은 AI 투자 가치를 판단하기 위해 ‘토큰당 비용’을 측정한다. 오픈AI는 여기에 맹점이 있다고 말한다. 값싼 모델이라도 원하는 결과를 얻기까지 여러 번 시도해야 한다면 총비용은 늘어나고, 반대로 토큰 단가가 높아도 한 번에 정확한 결과를 내놓는다면 전체 비용은 줄어들 수 있어서다.
사라 프라이어(Sarah Friar) 오픈AI CFO는 최근 자사 블로그를 통해 “성공적인 결과를 도출하는 데 드는 전체 비용과 그 결과로 창출해낸 가치를 비교하는 것”이 중요하다며, ‘달러당 유용한 지능’이라는 새로운 지표를 제안했다.
크게 네 가지 질문이 포함된다. AI가 중요한 일을 완수하고 있는지, 각 작업의 비용은 얼마인지, 사람들이 결과에 의존할 수 있는지, 사용량이 증가함에 따라 더 많은 가치를 창출하는지다.
1. 실제로 얼마나 많은 일을 했나
출발점은 업무 그 자체다. AI가 해결한 고객 문의는 몇 건인지, 제출된 코드 변경은 몇 건인지, 검토한 계약서는 몇 건인지를 보는 것이다. 프라이어 CFO는 팀마다 ‘완료’의 기준을 먼저 정하라고 권한다. 고객 지원팀이라면 문제 해결, 엔지니어링팀이라면 테스트를 통과한 코드 변경, 법무팀이라면 기한 내 정확한 계약서 검토가 그 기준이 될 수 있다.
예시로 든 건 예측 검토를 준비하는 재무팀이다. 최신 자료를 찾고, 스프레드시트로 데이터를 옮기고, 탭 사이 숫자를 맞추고, 슬라이드를 다시 만드는 작업에 시간 대부분이 들어간다. 오픈AI의 기업용 협업 도구 챗GPT Work가 이 과정을 대신 맡아주면, 팀은 “무엇이 왜 바뀌었고, 이제 뭘 해야 하는지” 같은 진짜 질문에 시간을 쓸 수 있다는 설명도 덧붙였다.
2. 업무 한 건당 얼마 드는가
두 번째는 비용이다. 계산식은 단순하다. 업무 완수에 들어간 전체 비용을 품질 기준을 충족한 과업 수로 나누면 된다. 여기서 전체 비용에는 모델 사용료뿐 아니라 직원이 검토하고 재작업하는 시간까지 포함된다. 토큰이 가장 싼 모델이 결과물당 비용까지 가장 싸다고 볼 수는 없는 이유다.
프라이어 CFO는 최근 출시된 GPT-5.6을 예로 들었다. 성능 위주의 Sol, 성능과 비용 균형을 맞춘 Terra, 가장 빠르고 저렴한 Luna로 나뉜 3단 구성인데, 어떤 걸 쓸지는 업무의 성격에 따라 정하면 된다는 설명이다. 대량의 단순 작업엔 Luna, 깊이가 필요한 작업엔 Terra, 최소 시도로 최고 결과가 필요할 땐 Sol을 쓰는 식이다.
수치도 제시했다. Artificial Analysis의 코딩 에이전트 지수에서 GPT-5.6 Sol(최대 추론 설정)은 기존 선두 모델보다 출력 토큰을 54% 적게 쓰면서 최고 성능을 기록했다고 밝혔다. 장기 엔지니어링 과업을 측정하는 DeepSWE v1.1 벤치마크에서는 72.7%로 Claude Fable 5의 69.9%를 앞섰고, 추정 API 비용은 36.2% 낮았다고 밝혔다. 해당 수치는 오픈AI 자체 발표 기준이다.
3. AI 결과물 믿고 쓸 수 있는지
세 번째는 신뢰성이다. 프라이어 CFO는 기업의 AI 도입이 단계적으로 깊어진다고 본다. 처음엔 초안 작성을 돕는 수준에서 시작해, 점차 여러 도구와 데이터를 넘나들며 맥락을 찾고, 나중엔 사람의 판단이 필요한 지점에서만 개입받으며 업무를 직접 처리하는 단계로 간다는 것이다.
이를 확인할 방법으로는 세 가지 지표를 제시했다. 결과물을 바로 쓸 수 있는지(Ready to use), 재시도나 사람의 수정이 필요한지(Needs correction), 아예 사람이 직접 나서야 하는지(Needs escalation)다. 단순히 답변의 정확도보다 이 지표들이 AI가 실제로 일손을 덜어주고 있는지 더 잘 보여준다는 설명이다.
동시에 경계도 분명히 해야 한다고 강조했다. AI가 초안 작성을 넘어 직접 실행하는 단계로 가기 전에, 접근 가능한 데이터 범위와 변경 가능한 시스템, 사람의 승인이 필요한 시점을 미리 정의해야 한다는 것이다.
4. 규모 커질수록 남는 장사인가
마지막은 확장성이다. 같은 워크플로우를 시간에 따라 추적해, 완료된 업무량이 총비용보다 빠르게 늘어나는지 보라는 것이다. 품질이 유지되면서 이 격차가 벌어진다면 투자한 1달러의 가치가 시간이 지날수록 커지고 있다는 뜻이다.
프라이어 CFO는 이 방정식의 중심에 컴퓨팅 자원이 있다고 말한다. 학습에 쓰는 컴퓨팅이 미래의 성능을 만들고, 추론에 쓰는 컴퓨팅이 당장의 업무를 처리한다. 더 나은 모델과 효율적인 추론, 전용 하드웨어가 맞물리면서 고객이 체감하는 건 결국 “더 나은 답변, 더 빠른 결과, 더 적은 수정, 더 낮은 비용”이라는 것이다.
프라이어 CFO는 “새로운 AI 모델이 나올 때마다 이 네 가지를 종합적으로 따져가면서 달러당 유용한 지능이 개선되고 있는지 판단할 수 있다”며, “오픈AI의 목표도 더 많은 가치와 더 낮은 비용을 동시에 개선하는 것”이라고 밝혔다.
해당 아티클은 AI 시장 경쟁이 치열해지는 가운데 오픈AI가 자사 모델의 강점을 홍보하기 위한 목적을 담고 있다. 하지만 AI 투자 성과를 어떤 식으로 측정해야 할지 고민 중인 기업이라면 이를 참고해 기준을 설계해도 좋을 것 같다.
외부 링크 대신 채팅창으로… 챗GPT ‘대화형’ 광고 도입
파일럿 단계… 브랜드 에이전트와 직접 소통
AI 답변에 쓰인 내 콘텐츠, 보상 받을 수 있다? 구글, 비공개 테스트 진행
AI 시대 고품질 콘텐츠 데이터 확보를 위한 움직임
뉴스콘텐츠는 저작권법 제7조 규정된 단서조항을 제외한 저작물로서 저작권법의 보호대상입니다. 본 기사를 개인블로그 및 홈페이지, 카페 등에 게재(링크)를 원하시는 분은 반드시 기사의 출처(로고)를 붙여주시기 바랍니다. 영리를 목적으로 하지 않더라도 출처 없이 본 기사를 재편집해 올린 해당 미디어에 대해서는 합법적인 절차(지적재산권법)에 따라 그 책임을 묻게 되며, 이에 따른 불이익은 책임지지 않습니다.
- 에디터장준영 (zzangit@ditoday.com)

