Tesla V100

2 posts

llama.cpp によるモデルの自作量子化(Quantization)

Hugging Faceからオリジナル精度(FP16/BF16)の生の重み(Safetensors)を入手し、llama.cpp の変換スクリプトで無圧縮のGGUF(FP16)を作成。そこからC++ネイティブの llama-quantize で4bit(Q4_K_M)へ量子化し、自作した量子化モデルがV100で高速かつ論理破綻なく動くことを確認した記録。 前 …

Read more: llama.cpp によるモデルの自作量子化(Quantization)

llama.cpp ネイティブ環境構築とTesla V100フル稼働の記録

Ollamaのようなラッパー(ブラックボックス)を排除し、C/C++ネイティブの llama.cpp をソースからビルドして、Tesla V100(32GB)の性能を限界まで引き出す。エッジAI・組み込みAIの基礎になる「量子化」や「ローレベルな推論制御」を自分の手で握るためのベース環境を作った記録。 前提環境 # OS: Ubuntu …

Read more: llama.cpp ネイティブ環境構築とTesla V100フル稼働の記録