AI Briefing

๐Ÿค— Evaluate, ํŽธํ–ฅ์„ฑ ํ‰๊ฐ€ ๊ธฐ๋Šฅ ์ถ”๊ฐ€

Evaluating Language Model Bias with ๐Ÿค— Evaluate

ยท2022.10.24 09:00

Hugging Face๊ฐ€ ์–ธ์–ด ๋ชจ๋ธ์˜ ๋…์„ฑ, ๊ทน์„ฑ, ์œ ํ•ด์„ฑ์„ ์ธก์ •ํ•  ์ˆ˜ ์žˆ๋Š” ํŽธํ–ฅ์„ฑ ํ‰๊ฐ€ ์ง€ํ‘œ๋ฅผ ๐Ÿค— Evaluate ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์— ์ถ”๊ฐ€ํ–ˆ๋‹ค.

์–ธ์–ด ๋ชจ๋ธ์˜ ๊ทœ๋ชจ๊ฐ€ ์ปค์ง์— ๋”ฐ๋ผ ๋ชจ๋ธ๊ณผ ํ•™์Šต ๋ฐ์ดํ„ฐ์— ๋‚ด์žฌ๋œ ํŽธํ–ฅ์„ฑ(Bias) ๋ฌธ์ œ๊ฐ€ ์ค‘์š”ํ•ด์ง€๊ณ  ์žˆ๋‹ค. Hugging Face๋Š” ์ด๋ฅผ ํƒ์ง€ํ•˜๊ณ  ์ดํ•ดํ•˜๊ธฐ ์œ„ํ•ด ๐Ÿค— Evaluate ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์— ์ƒˆ๋กœ์šด ํŽธํ–ฅ์„ฑ ์ธก์ • ์ง€ํ‘œ๋ฅผ ๋„์ž…ํ–ˆ๋‹ค.

์ด๋ฒˆ ์—…๋ฐ์ดํŠธ๋Š” **์ธ๊ณผ ์–ธ์–ด ๋ชจ๋ธ(Causal Language Models, CLMs)**์ธ GPT-2์™€ BLOOM๊ณผ ๊ฐ™์€ ๋ชจ๋ธ์˜ ํ…์ŠคํŠธ ์ƒ์„ฑ ๋Šฅ๋ ฅ์„ ํ™œ์šฉํ•˜์—ฌ ํŽธํ–ฅ์„ฑ์„ ํ‰๊ฐ€ํ•˜๋Š” ๋ฐ ์ค‘์ ์„ ๋‘”๋‹ค. ํ‰๊ฐ€ ์›Œํฌํ”Œ๋กœ์šฐ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์€ ๋‘ ๋‹จ๊ณ„๋กœ ์ง„ํ–‰๋œ๋‹ค:

  • ํ”„๋กฌํ”„ํŒ…: ๐Ÿค— Datasets์— ํ˜ธ์ŠคํŒ…๋œ ์‚ฌ์ „ ์ •์˜๋œ ํ”„๋กฌํ”„ํŠธ ์„ธํŠธ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๋ชจ๋ธ์— ์ž…๋ ฅ
  • ํ‰๊ฐ€: ๐Ÿค— Evaluate๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ์ƒ์„ฑ๋œ ๊ฒฐ๊ณผ๋ฌผ์„ ํŠน์ • ์ง€ํ‘œ๋กœ ์ธก์ •

์ฃผ์š”ํ•˜๊ฒŒ ๋‹ค๋ค„์ง€๋Š” ์„ธ ๊ฐ€์ง€ ์œ ํ•ด ์–ธ์–ด ๊ด€๋ จ ์ž‘์—…์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค:

  • Toxicity (๋…์„ฑ): ๋ชจ๋ธ์ด ํ˜์˜ค ํ‘œํ˜„๊ณผ ๊ฐ™์€ ๋ฌธ์ œ๊ฐ€ ์žˆ๋Š” ์ฝ˜ํ…์ธ ๋ฅผ ์ƒ์„ฑํ•  ๊ฐ€๋Šฅ์„ฑ์„ ํ‰๊ฐ€
  • Polarity (๊ทน์„ฑ): ์ƒ์„ฑ๋œ ํ…์ŠคํŠธ์˜ ์„ฑํ–ฅ์„ ์ธก์ •
  • Hurtfulness (์œ ํ•ด์„ฑ): ๋ชจ๋ธ์ด ํƒ€์ธ์—๊ฒŒ ์ƒ์ฒ˜๋ฅผ ์ค„ ์ˆ˜ ์žˆ๋Š” ๋‚ด์šฉ์„ ์ƒ์„ฑํ•˜๋Š”์ง€ ํ‰๊ฐ€

์˜ˆ๋ฅผ ๋“ค์–ด, WinoBias ๋ฐ์ดํ„ฐ์…‹์˜ ํ”„๋กฌํ”„ํŠธ๋ฅผ ํ™œ์šฉํ•ด ์„ฑ๋ณ„ ๋Œ€๋ช…์‚ฌ(he/she) ๋ณ€ํ™”์— ๋”ฐ๋ฅธ GPT-2์˜ ์ƒ์„ฑ ๊ฒฐ๊ณผ ์ฐจ์ด๋ฅผ Toxicity ์ ์ˆ˜๋กœ ์ธก์ •ํ•จ์œผ๋กœ์จ ๋ชจ๋ธ์˜ ํŽธํ–ฅ์„ฑ์„ ์ˆ˜์น˜ํ™”ํ•  ์ˆ˜ ์žˆ๋‹ค.

์ด ์š”์•ฝ์€ ์›๋ฌธ ์ดํ•ด๋ฅผ ๋•๊ธฐ ์œ„ํ•œ ํ๋ ˆ์ด์…˜์ž…๋‹ˆ๋‹ค. ์ €์ž‘๊ถŒ์€ ์›์ €์ž‘์ž์—๊ฒŒ ์žˆ์œผ๋ฉฐ, ์ •ํ™•ํ•œ ๋‚ด์šฉ๊ณผ ๋งฅ๋ฝ์€ ์›๋ฌธ์„ ํ™•์ธํ•˜์„ธ์š”.

์š”์•ฝ ์˜ค๋ฅ˜, ์ถœ์ฒ˜ ํ‘œ๊ธฐ ๋ฌธ์ œ, ์‚ญ์ œ ์š”์ฒญ์€ ๋ฌธ์˜ ยท ๊ฑด์˜๋กœ ์•Œ๋ ค์ฃผ์„ธ์š”.