Llama.cpp

3 posts

Ollamaとは何か? ローカルLLM推論エンジンの比較

ローカルLLMを動かすエンジンの一つ Ollama とは何か、そして代表的な推論ソフトの比較。基盤構築の初期に整理したもの。 Ollamaは一言でいうと「複雑なローカルLLMの環境構築を極限まで簡略化し、使いやすいAPIとして提供するラッパー」。内部では C++製の軽量・高速な推論エンジン llama.cpp が動いている。本来 llama.cpp を直接扱 …

Read more: Ollamaとは何か? ローカルLLM推論エンジンの比較

llama.cpp によるモデルの自作量子化(Quantization)

Hugging Faceからオリジナル精度(FP16/BF16)の生の重み(Safetensors)を入手し、llama.cpp の変換スクリプトで無圧縮のGGUF(FP16)を作成。そこからC++ネイティブの llama-quantize で4bit(Q4_K_M)へ量子化し、自作した量子化モデルがV100で高速かつ論理破綻なく動くことを確認した記録。 前 …

Read more: llama.cpp によるモデルの自作量子化(Quantization)

llama.cpp ネイティブ環境構築とTesla V100フル稼働の記録

Ollamaのようなラッパー(ブラックボックス)を排除し、C/C++ネイティブの llama.cpp をソースからビルドして、Tesla V100(32GB)の性能を限界まで引き出す。エッジAI・組み込みAIの基礎になる「量子化」や「ローレベルな推論制御」を自分の手で握るためのベース環境を作った記録。 前提環境 # OS: Ubuntu …

Read more: llama.cpp ネイティブ環境構築とTesla V100フル稼働の記録