compareボタン(TrainブロックまたはHistory)が、ベースモデルと学習済みモデルを並べます:
- Perplexity (ppl):言語モデルの誤差 — 低いほど自信あり。~29 → ~3 の低下は、データセットのスタイルが本当に学ばれた証拠。
- eval loss:取っておいたスプリットで測定(eval_pct>0の場合)。
- サンプル生成:同じプロンプトを両モデルに送り、行動の違いを目で確認できます。

ヒント:チューニング済みpplがベース並みのままなら、エポック不足か、データセットが目的と合っていないか、です。
