๐ค Evaluate, ํธํฅ์ฑ ํ๊ฐ ๊ธฐ๋ฅ ์ถ๊ฐ
Evaluating Language Model Bias with ๐ค Evaluate
Hugging Face๊ฐ ์ธ์ด ๋ชจ๋ธ์ ๋ ์ฑ, ๊ทน์ฑ, ์ ํด์ฑ์ ์ธก์ ํ ์ ์๋ ํธํฅ์ฑ ํ๊ฐ ์งํ๋ฅผ ๐ค Evaluate ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ์ถ๊ฐํ๋ค.
์ธ์ด ๋ชจ๋ธ์ ๊ท๋ชจ๊ฐ ์ปค์ง์ ๋ฐ๋ผ ๋ชจ๋ธ๊ณผ ํ์ต ๋ฐ์ดํฐ์ ๋ด์ฌ๋ ํธํฅ์ฑ(Bias) ๋ฌธ์ ๊ฐ ์ค์ํด์ง๊ณ ์๋ค. Hugging Face๋ ์ด๋ฅผ ํ์งํ๊ณ ์ดํดํ๊ธฐ ์ํด ๐ค Evaluate ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ์๋ก์ด ํธํฅ์ฑ ์ธก์ ์งํ๋ฅผ ๋์ ํ๋ค.
์ด๋ฒ ์ ๋ฐ์ดํธ๋ **์ธ๊ณผ ์ธ์ด ๋ชจ๋ธ(Causal Language Models, CLMs)**์ธ GPT-2์ BLOOM๊ณผ ๊ฐ์ ๋ชจ๋ธ์ ํ ์คํธ ์์ฑ ๋ฅ๋ ฅ์ ํ์ฉํ์ฌ ํธํฅ์ฑ์ ํ๊ฐํ๋ ๋ฐ ์ค์ ์ ๋๋ค. ํ๊ฐ ์ํฌํ๋ก์ฐ๋ ๋ค์๊ณผ ๊ฐ์ ๋ ๋จ๊ณ๋ก ์งํ๋๋ค:
- ํ๋กฌํํ : ๐ค Datasets์ ํธ์คํ ๋ ์ฌ์ ์ ์๋ ํ๋กฌํํธ ์ธํธ๋ฅผ ์ฌ์ฉํ์ฌ ๋ชจ๋ธ์ ์ ๋ ฅ
- ํ๊ฐ: ๐ค Evaluate๋ฅผ ์ฌ์ฉํ์ฌ ์์ฑ๋ ๊ฒฐ๊ณผ๋ฌผ์ ํน์ ์งํ๋ก ์ธก์
์ฃผ์ํ๊ฒ ๋ค๋ค์ง๋ ์ธ ๊ฐ์ง ์ ํด ์ธ์ด ๊ด๋ จ ์์ ์ ๋ค์๊ณผ ๊ฐ๋ค:
- Toxicity (๋ ์ฑ): ๋ชจ๋ธ์ด ํ์ค ํํ๊ณผ ๊ฐ์ ๋ฌธ์ ๊ฐ ์๋ ์ฝํ ์ธ ๋ฅผ ์์ฑํ ๊ฐ๋ฅ์ฑ์ ํ๊ฐ
- Polarity (๊ทน์ฑ): ์์ฑ๋ ํ ์คํธ์ ์ฑํฅ์ ์ธก์
- Hurtfulness (์ ํด์ฑ): ๋ชจ๋ธ์ด ํ์ธ์๊ฒ ์์ฒ๋ฅผ ์ค ์ ์๋ ๋ด์ฉ์ ์์ฑํ๋์ง ํ๊ฐ
์๋ฅผ ๋ค์ด, WinoBias ๋ฐ์ดํฐ์ ์ ํ๋กฌํํธ๋ฅผ ํ์ฉํด ์ฑ๋ณ ๋๋ช ์ฌ(he/she) ๋ณํ์ ๋ฐ๋ฅธ GPT-2์ ์์ฑ ๊ฒฐ๊ณผ ์ฐจ์ด๋ฅผ Toxicity ์ ์๋ก ์ธก์ ํจ์ผ๋ก์จ ๋ชจ๋ธ์ ํธํฅ์ฑ์ ์์นํํ ์ ์๋ค.
์ด ์์ฝ์ ์๋ฌธ ์ดํด๋ฅผ ๋๊ธฐ ์ํ ํ๋ ์ด์ ์ ๋๋ค. ์ ์๊ถ์ ์์ ์์์๊ฒ ์์ผ๋ฉฐ, ์ ํํ ๋ด์ฉ๊ณผ ๋งฅ๋ฝ์ ์๋ฌธ์ ํ์ธํ์ธ์.
์์ฝ ์ค๋ฅ, ์ถ์ฒ ํ๊ธฐ ๋ฌธ์ , ์ญ์ ์์ฒญ์ ๋ฌธ์ ยท ๊ฑด์๋ก ์๋ ค์ฃผ์ธ์.