llama.cpp によるモデルの自作量子化(Quantization)
Hugging Faceからオリジナル精度(FP16/BF16)の生の重み(Safetensors)を入手し、llama.cpp の変換スクリプトで無圧縮のGGUF(FP16)を作成。そこからC++ネイティブの llama-quantize で4bit(Q4_K_M)へ量子化し、自作した量子化モデルがV100で高速かつ論理破綻なく動くことを確認した記録。 前 …
Read more: llama.cpp によるモデルの自作量子化(Quantization)