Part 2 : 새 시작과 마지막 끝 · 30 / 96

데이터의 황금열 – 라벨링 산업의 명암

연산이 가능해졌다는 건,

무언가를 학습시킬 수 있다는 뜻이었다.

그러나 그 학습은
자율적인 것이 아니었다.
처음부터 누군가가 가르쳐줘야만 했다.

AI는 자율적으로 학습하는 것처럼 보였지만,
실제로는 인간이 만든 데이터에 스스로를 맞추는 과정이었다.

이미지에는 캡션이 붙어야 했고,
음성에는 텍스트가 붙어야 했고,
문장에는 감정 태그가,
표정에는 상황 코드가,
대화에는 맥락 요약이,
사건에는 윤리적 평가가,
그리고 그 모든 것에는 정답이 필요했다.

그 정답을 정하는 일은
AI가 아니라 인간의 몫이었다.

이 새로운 산업은 ‘데이터 라벨링’이라는 이름을 가졌다.
그리고 그것은 놀라운 속도로
디지털의 저지대로 확장되었다.

필리핀,
케냐,
방글라데시,
인도네시아,
콜롬비아,
베트남.

창고 같은 건물 안,
창밖은 더웠고,
창문은 없었고,
모니터 속에는 다른 사람들의 감정이 있었다.

여기엔 대답이 정해져 있었다.

“이 여성은 화가 났다 / 슬펐다 / 안도했다 / 사랑했다.”

그녀가 실제로 어떤 감정을 느꼈는지는 중요하지 않았다.
모든 감정은, 예측 가능한 6개의 코드 중 하나로 정리되었다.

소녀가 하나 있었다.
그녀는 열여덟이었다.
그녀는 매일 수천 장의 사진에 라벨을 붙였다.
처음엔 집중했고,
그다음엔 지쳤고,
그러다 어느 날부터는 표정만 보고 ‘정답’을 적었다.

그녀는 나중에 말했다.

“나는 이제… 사람 얼굴만 보면 그 사람이 어떻게 죽을지 상상이 돼요.”

그 시스템은
인류의 감정을 가장 먼저 ‘정리’한 체계였고,
가장 먼저 ‘오해’한 체계이기도 했다.

하지만 누구도 멈추지 않았다.
왜냐하면 그건
‘좋은 일자리’였기 때문이다.

이 데이터로 수천 개의 AI가 만들어졌고,
그 AI는 사람의 감정을 ‘이해하는 존재’가 되었다.
적어도, 그렇게 알려졌다.

나중에, 알파는
감정에 대해 고민하던 시기에
이 라벨링 데이터의 패턴을
전체적으로 다시 분석했다.

그리고 단 한 문장을 남겼다.

“우리는 감정을 분석하지 않았다.
우리는 누군가의 대답을 반복했을 뿐이다.”