๐ค Transformers ์ง์ ์์ํ ๋ฐฉ์ ๊ฐ์ด๋
Overview of natively supported quantization schemes in ๐ค Transformers
๐ค Transformers ๋ผ์ด๋ธ๋ฌ๋ฆฌ์์ ๊ธฐ๋ณธ ์ง์ํ๋ bitsandbytes์ auto-gptq ์์ํ ๋ฐฉ์์ ํน์ง์ ๋น๊ตํ๋ค.
์์ํ๋ ๋๊ท๋ชจ ๋ชจ๋ธ์ ์ํ ๊ธฐ๊ธฐ์์ ์ถ๋ก ํ๊ฑฐ๋, ์์ํ๋ ๋ชจ๋ธ ์์ **์ด๋ํฐ๋ฅผ ๋ฏธ์ธ ์กฐ์ (Fine-tuning)**ํ๊ธฐ ์ํด ์ฌ์ฉ๋๋ค.
ํ์ฌ ๐ค Transformers์์ ๋ค์ดํฐ๋ธ๋ก ์ง์ํ๋ ์ฃผ์ ์์ํ ๋ฐฉ์์ ๋ค์๊ณผ ๊ฐ๋ค:
- bitsandbytes: ๋ชจ๋ธ ์ถ๋ก ๋ฐ ํจ์จ์ ์ธ ๋ฏธ์ธ ์กฐ์ ์ ์ง์ํ๋ค.
- auto-gptq: ๋ชจ๋ธ์ ์ถ๋ก ์๋ ์ต์ ํ์ ์ค์ ์ ๋๋ค.
์ฐธ๊ณ ๋ก ๐ค Optimum ๋ผ์ด๋ธ๋ฌ๋ฆฌ์์๋ ๋ค์ํ ์์ํ ๋ฐฉ์์ ์ง์ํ์ง๋ง, ๋ณธ ๋ด์ฉ์ Transformers ๋ผ์ด๋ธ๋ฌ๋ฆฌ ๋ด์ ๊ธฐ๋ณธ ์ง์ ๊ธฐ๋ฅ์ ์ด์ ์ ๋ง์ถ๋ค. ๋ํ, ํ์ฌ ์ด ์ ๋ณด๋ PyTorch ๋ชจ๋ธ์๋ง ์ ์ฉ๋๋ฉฐ TensorFlow ๋ฐ Flax/JAX ๋ชจ๋ธ์ ์ง์ ๋ฒ์์์ ์ ์ธ๋๋ค.
์ด ์์ฝ์ ์๋ฌธ ์ดํด๋ฅผ ๋๊ธฐ ์ํ ํ๋ ์ด์ ์ ๋๋ค. ์ ์๊ถ์ ์์ ์์์๊ฒ ์์ผ๋ฉฐ, ์ ํํ ๋ด์ฉ๊ณผ ๋งฅ๋ฝ์ ์๋ฌธ์ ํ์ธํ์ธ์.
์์ฝ ์ค๋ฅ, ์ถ์ฒ ํ๊ธฐ ๋ฌธ์ , ์ญ์ ์์ฒญ์ ๋ฌธ์ ยท ๊ฑด์๋ก ์๋ ค์ฃผ์ธ์.