not · büyüyor

Fine-tuning yöntemleri

Full SFT, LoRA, QLoRA, DPO, GRPO, distillation — ve her birinin ne zaman cevap olduğu.

Sıfırdan eğitmek neredeyse hiçbir ürün ekibinin işi değil. Pratikte seçim, hangi parameter-efficient yöntem olduğu.

YöntemNe yaparNe zaman
Full SFTher ağırlığı güncellernadiren — pahalı, unutkan
LoRAdonmuş model üstüne low-rank adaptervarsayılan başlangıç noktası
QLoRA4-bit base üstüne LoRAtek GPU’ya sığdırmak için
DPOtercih çiftleri üzerinden hizalariyi/kötü cevap çiftlerin varsa
GRPObir reward fonksiyonuna karşı RLdoğruluk programatik olarak kontrol edilebiliyorsa
Distillationbüyük modeli küçüğe kopyalarmaliyet ve latency baskısı
pratik yol
Derle200-500 örnek
QLoRA SFT
DPOçiftlerin varsa
Evalyayına almadan önce

Adapter, retrieval’ın yerini tutmaz. Fine-tune edilmiş model hiç görmediği dokümanı yine uydurur — sadece daha güzel bir formatta.

#lora #qlora #dpo

Bu notu beyaz tahtada gör →