第 11 课,共 12 课

GGUF 导出与 llama.cpp

输出块(或历史里的运行行)上的 GGUF 按钮会合并模型,并在运行目录旁写出一个 .gguf 文件——可直接用于 llama.cpp / Ollama / LM Studio:

  • quant:f16(精确、大)、q8_0(低误差、小巧——推荐)和 q4_k_m 等 K-quant(需要 PATH 里有 llama-quantize 或设置 TT_LLAMA_CPP)。
  • 导出进度显示在弹窗中;完成后给出文件路径和下载。
  • 元数据完好:分词器、架构和注意力偏置全部保留——导出模型的回复与源模型一致。
GGUF 导出
提示:q8_0 导出会保持与源模型一致的回复——分词器、架构和 attention 设置全部保留。
课程目录 · 第 11 课,共 12 课
TheTensorTune workbench