12レッスン中のレッスン 11

GGUFエクスポートとllama.cpp

出力ブロック(またはHistoryのラン行)のGGUFボタンがモデルをマージし、runの横に.ggufファイルを書き出します — llama.cpp / Ollama / LM Studioでそのまま使えます:

  • quant:f16(正確、大容量)、q8_0(低誤差・コンパクト — 推奨)、q4_k_m等のK-quant(PATH上のllama-quantizeまたはTT_LLAMA_CPPが必要)。
  • エクスポートの進捗はモーダルに表示。完了するとファイルパスとダウンロードが提供されます。
  • メタデータは intact:トークナイザ、アーキテクチャ、attentionバイアスが保持され、エクスポート済みモデルの応答は元モデルと一致します。
GGUFエクスポート
ヒント:q8_0のエクスポートは元モデルと同じ応答を返します — トークナイザー、アーキテクチャ、attention設定がすべて保持されます。
コース目次 · 12レッスン中のレッスン 11
TheTensorTune workbench