دکمهی مقایسه (روی بلوک Train یا تاریخچه) مدل پایه و مدل آموزشدیده را کنار هم میگذارد:
- Perplexity (ppl): خطای زبانی — هرچه کمتر، مدلِ مطمئنتر. افت ppl از مثلاً ~۲۹ به ~۳ یعنی مدل سبک دیتاست را یاد گرفته است.
- eval loss: روی split اعتبارسنجی (اگر eval_pct>0 داشته باشید).
- نمونهی خروجی: همان پرامپت به هر دو مدل داده میشود تا تفاوت رفتار را با چشم ببینید.

نکته: اگر ppl مدل آموزشدیده بهِ پایه نزدیک ماند، یا epochs کم بوده یا دیتاست با هدفتان همراستا نیست.
