not · büyüyor
Fine-tuning yöntemleri
Full SFT, LoRA, QLoRA, DPO, GRPO, distillation — ve her birinin ne zaman cevap olduğu.
Sıfırdan eğitmek neredeyse hiçbir ürün ekibinin işi değil. Pratikte seçim, hangi parameter-efficient yöntem olduğu.
| Yöntem | Ne yapar | Ne zaman |
|---|---|---|
| Full SFT | her ağırlığı günceller | nadiren — pahalı, unutkan |
| LoRA | donmuş model üstüne low-rank adapter | varsayılan başlangıç noktası |
| QLoRA | 4-bit base üstüne LoRA | tek GPU’ya sığdırmak için |
| DPO | tercih çiftleri üzerinden hizalar | iyi/kötü cevap çiftlerin varsa |
| GRPO | bir reward fonksiyonuna karşı RL | doğruluk programatik olarak kontrol edilebiliyorsa |
| Distillation | büyük modeli küçüğe kopyalar | maliyet ve latency baskısı |
Derle200-500 örnek
QLoRA SFT
DPOçiftlerin varsa
Evalyayına almadan önce
Adapter, retrieval’ın yerini tutmaz. Fine-tune edilmiş model hiç görmediği dokümanı yine uydurur — sadece daha güzel bir formatta.