본문 바로가기

반응형

배움 조각 (AI)

(2)
프론트엔드 코딩 1위 Kimi K3의 수학 정확도는 39%, 벤치마크를 읽는 법 새 AI 모델이 개발자가 결과물을 직접 보고 고르는 코딩 평가에서 여러 모델을 제치고 1위를 차지했습니다. 그런데 같은 모델은 고난도 수학 시험에서 100점 만점으로 치면 약 39점 수준에 그쳤습니다. 오타가 아니라 실제 결과입니다. AI 성능 뉴스에는 "1위", "최고 점수"라는 말이 자주 등장합니다. 이 사례만 봐도 그런 숫자를 어떻게 읽어야 하는지 알 수 있습니다. 주인공은 중국 Moonshot AI가 공개한 Kimi K3입니다. 이 글은 Kimi K3를 소개하려는 글이 아닙니다. 이 모델의 엇갈린 성적표를 바탕으로 "AI 순위표를 어떻게 받아들여야 하나"를 짚어 보려 합니다. AI 벤치마크란 무엇인가벤치마크(benchmark)는 AI 모델의 성적표입니다. 정해진 문제 묶음을 여러 모델이 똑같이 풀..
폰에 넣으려고 270억짜리 AI를 3.9GB로 줄이면, 무엇을 잘하고 무엇을 못할까 최근 "아이폰에서 270억 개짜리 AI가 돌아간다" 는 소식이 화제였습니다. 얼마 전만 해도 이만한 크기의 AI는 폰에 넣을 엄두조차 못 냈으니, 대단한 진전은 맞습니다. 그런데 여기엔 짚고 넘어갈 대목이 있습니다. 그 큰 걸 대체 어떻게 폰에 집어넣었을까요? 또 그렇게 줄인 AI는 무엇을 잘하고, 무엇을 못할까요? 이 글은 그 비결인 '양자화'를 처음부터 차근차근 풀어봅니다. 다 읽고 나면 앞으로 "폰에서 GPT급 AI가 돌아간다" 같은 소식을 봤을 때, 그게 나에게 무슨 의미인지 스스로 가늠할 수 있습니다.1. 폰에 넣기 어려웠던 이유AI 모델은 뜯어보면 결국 숫자(가중치) 덩어리입니다. "270억 개짜리(27B)"란 이 숫자가 270억 개나 된다는 뜻입니다.모델 크기는 의외로 간단한 곱으로 정해집니..

반응형