AI 편향은 어디서 오나
사전학습·미세조정·RLHF, 세 단계 모두에 스며든다
① "AI 편향"은 하나가 아니다. 표상 편향·고정관념 편향·언어문화 편향 등 서로 다른 문제를 뭉뚱그려 부르는 경우가 많다.
② 편향은 버그가 아니라 학습 과정 그 자체의 결과다. 사전학습·미세조정·RLHF 세 단계 모두에서 각기 다른 방식으로 편향이 들어온다.
③ "더 다양한 데이터로 학습시키면 해결된다"는 생각은 절반만 맞다. 실제로는 모범 사례로 삼을 만한 해법이 아직 없다 — 데이터를 늘려도, 교정을 걸어도 새로운 형태의 문제가 생긴다.
① 편향은 한 가지가 아니다 — 먼저 구분부터
"AI가 편향됐다"는 말은 실제로는 여러 다른 현상을 가리킨다. 뭉뚱그려 이야기하면 원인도 해법도 뒤섞인다.
| 유형 | 내용 | 예시 |
|---|---|---|
| 표상 편향 | 특정 집단·언어·지역이 학습 데이터에 적게 등장 | 영어 텍스트가 압도적으로 많아 다른 언어권 성능이 떨어짐 |
| 고정관념 편향 | 직업·성별·인종 등을 특정 속성과 통계적으로 결부 | "의사"는 남성으로, "간호사"는 여성으로 기본 가정 |
| 언어·문화 편향 | 특정 문화권의 관습·가치관을 "기본값"으로 취급 | 날짜 형식·가족 구조·명절 등을 서구 기준으로 서술 |
| 정치·관점 편향 | 논쟁적 사안에서 특정 입장 쪽으로 답변이 기울어짐 | 양쪽 의견이 있는 사안을 한쪽만 강조해 서술 |
이 글은 이 네 가지가 어느 단계에서, 왜 생기는지를 AI는 어떻게 만들어지나에서 다룬 3단계 파이프라인(사전학습→미세조정→RLHF)을 따라가며 짚는다.
② 사전학습 — 인터넷 자체가 편향돼 있다
사전학습이 하는 일은 단 하나, "다음 토큰 맞히기"를 인터넷 규모 텍스트로 수조 번 반복하는 것이다. 이 과정에서 문법·지식·추론 능력이 부산물로 생기는데, 편향도 정확히 같은 방식으로 부산물로 딸려온다.
문제는 인터넷 텍스트가 인류 전체를 대표하는 균형 잡힌 표본이 아니라는 점이다. 특정 언어(영어)·특정 시기·인터넷 접근성이 높았던 집단의 글이 압도적으로 많다. 그리고 그 텍스트 안에는 과거부터 실제로 존재해온 통계적 편중(특정 직업에 특정 성별이 많았던 시절의 기록 등)이 그대로 담겨 있다.
모델의 유일한 목표는 학습 데이터의 통계적 패턴을 정확히 예측하는 것이다. 데이터 안에 "이 직업 옆에는 이 대명사가 더 자주 나온다"는 패턴이 있으면, 모델은 그 패턴을 정확히 학습한 것이다 — 의도가 아니라 정확도의 결과다. 환각이 "거짓말하려는 의도" 없이 생기는 것과 같은 구조다.
실제 사례가 있다. 아마존은 2014~2017년 이력서 10년 치를 학습시켜 채용 후보를 평가하는 AI 도구를 개발했는데, 그 10년 치 이력서 자체가 남성 지원자 위주였다. 모델은 이 패턴을 그대로 학습해 "women's"라는 단어가 포함된 이력서(예: "women's chess club captain")를 낮게 평가하고, 여자대학 졸업자를 감점했다. 아마존은 특정 단어를 손보는 식으로 고치려 했지만 모델이 계속 다른 방식으로 같은 차별을 재현했고, 결국 이 도구를 완전히 폐기했다(AI 사고 데이터베이스 기록).
③ 미세조정·RLHF — 사람이 고르는 순간에도 편향이 들어간다
미세조정은 사람이 작성·검토한 질문-답변 쌍으로, RLHF는 사람이 여러 답변 중 더 나은 쪽을 고르는 방식으로 모델을 다듬는다. 이 두 단계는 "사람이 직접 관여한다"는 점에서 사전학습과 다르지만, 그 사람들 역시 완전히 중립적이지 않다.
미세조정 데이터를 작성하는 사람, RLHF에서 답변을 비교 평가하는 평가자 집단이 특정 언어권·연령대·직군에 쏠려 있으면, 그 집단이 "좋다"고 느끼는 답변 스타일이 모델의 기본 성격으로 굳어진다. RLHF가 모델의 "말투·태도"를 결정한다는 원리를 뒤집어보면, 그 말투·태도가 누구의 기준으로 정해졌는지가 곧 편향의 통로가 된다는 뜻이다.
④ 왜 "데이터만 늘리면" 해결되지 않나
자연스러운 대응은 "더 다양한 데이터로 학습시키자"는 것이다. 실제로 도움이 되지만, 완전한 해법은 아니다. 두 가지 이유가 있다.
설령 인류 전체를 완벽하게 대표하는 텍스트를 모을 수 있다 해도, 그 텍스트가 묘사하는 현실 자체가 불균형했다면 그 불균형이 통계적 패턴으로 남는다. 데이터의 대표성 문제와 현실의 불균형 문제는 서로 다른 층위라, 하나를 고쳐도 다른 하나는 그대로 남는다.
둘째, 교정 자체가 새로운 실패를 만들 수 있다. 2024년 2월 구글은 제미나이의 이미지 생성 기능에서 인종 다양성을 강제로 반영하도록 조정했는데, 그 결과 "1943년 독일군"이나 "미국 건국의 아버지들"처럼 역사적으로 특정 인종이었던 인물까지 무작위로 다른 인종으로 바꿔 생성하는 부작용이 나타났다. 구글은 이 기능을 일시 중단하며 공식 블로그에서 "가이드 없이는 도구가 학습 데이터에 기반해 고정관념적인 이미지를 자연스럽게 만들어낸다"고 인정했다(구글 공식 블로그). 편향을 줄이려는 교정이 지나치면 정확성을 해치는 새로운 문제로 옮겨갈 뿐이라는 걸 보여준 사례다.
얼마나 편향돼 있는지, 어떻게 고치는 게 최선인지는 지금도 연구·논쟁이 진행 중인 영역이다. "이 모델은 편향이 없다"고 단정하는 주장은 의심해야 한다. 반대로 "AI는 원래 다 편향됐으니 신경 쓸 필요 없다"는 태도도 마찬가지로 게으른 결론이다.
⑤ 실제로 어떻게 나타나나 — 한국 사용자가 마주치는 유형
한국 사용자 입장에서 체감하기 쉬운 형태는 따로 있다.
| 증상 | 원인 |
|---|---|
| 한국어 답변이 영어보다 부정확하거나 어색함 | 학습 데이터의 압도적 다수가 영어 — 토큰 비용이 더 비싼 것과 같은 뿌리 |
| 날짜·주소·이름 형식, 명절·가족 구조 설명이 서구 기준 | 학습 데이터 자체가 서구권 텍스트 비중이 높음 |
| 직업·역할을 특정 성별로 기본 가정 | 고정관념 편향 — 사전학습 단계의 통계적 패턴 |
실제로 이런 문제가 방치되지 않도록 규제도 움직이고 있다. 미국 뉴욕시는 2023년부터 채용에 AI 도구를 쓰는 기업에 독립기관의 연례 편향 감사를 의무화했고, 2025년 말에는 감사를 누락한 업체에 실제 벌금이 부과된 사례도 나왔다(뉴욕시 공식 안내). EU AI Act도 채용·신용평가에 쓰이는 AI를 "고위험" 범주로 분류해 별도 의무를 지운다(EU AI Act 안내). 이건 "AI 편향이 이론적 우려가 아니라 실무·법적 리스크로 다뤄지기 시작했다"는 신호다.
⑥ 실전 체크리스트
□ 채용·대출·평가처럼 사람에게 영향이 큰 판단에는 AI 답변을 최종 결정이 아니라 참고 자료로만 쓰고, 사람이 최종 검토한다.
□ 논쟁적 주제는 반대 관점을 일부러 물어 한쪽으로 쏠린 답변인지 확인한다.
□ "기본값"으로 나온 가정(성별·문화·형식)이 자연스러운지 아니면 그냥 통계적으로 흔한 것인지 구분해서 본다.
□ 민감한 판단일수록 서로 다른 모델·서로 다른 프롬프트로 한 번 더 확인한다.
정리하면, AI 편향은 "고쳐야 할 버그"라기보다 "사람이 만든 데이터로 학습하는 한 계속 관리해야 할 특성"에 가깝다. 어디서 오는지 알면, 적어도 어떤 답변을 더 의심해야 하는지는 판단할 수 있다.
※ 본 글은 2026년 9월 기준 공개된 사례·연구를 바탕으로 하며, 특정 기업이나 제품을 비판하거나 투자를 권유하지 않습니다. 규제 현황은 계속 바뀔 수 있으니 실제 적용 여부는 해당 기관의 공식 자료를 확인하시기 바랍니다.
※ 본 가이드는 일반 교육 목적의 참고 자료이며, 이해를 돕기 위해 기술적 세부사항을 단순화했습니다.
새 가이드가 나오면 알려드립니다
AI 리터러시 가이드는 주 2회 발행합니다. 구독하시면 다음 편을 메일로 보내드립니다. 무료이고 언제든 해지할 수 있습니다.
