Die compare-Taste (am Train-Block oder in der Historie) stellt Basis- und trainiertes Modell nebeneinander:
- Perplexity (ppl): der Sprachmodell-Fehler — je niedriger, desto sicherer. Ein Abfall von ~29 auf ~3 heißt: Der Stil des Datensatzes wurde wirklich gelernt.
- Eval-Loss: gemessen am zurückgelegten Split (wenn eval_pct>0).
- Beispiel-Generierung: derselbe Prompt geht an beide Modelle, damit Sie den Verhaltensunterschied mit eigenen Augen sehen.

Tipp: Bleibt die ppl des trainierten Modells nahe der Basis, waren entweder die Epochen zu wenige oder der Datensatz passt nicht zum Ziel.
