deney · tohum
Embedding’i fine-tune etmek
Ham chunk’lardan sentetik sorular üret, embedding’i kendi kelime dağarcığınla eğit.
Retrieval’ı iyileştirmenin en az konuşulan yolu: modeli değil, embedding’i fine-tune etmek. Alan jargonuyla dolu bir corpus’ta bu, olabilecek en ucuz kazanım.
Ham chunk
LLM’e sorbu hangi soruyu cevaplıyor
(soru, chunk) çifti
Embedding’i eğit
Genel amaçlı bir embedding modeli şirketinin kısaltmalarını, parça numaralarını ya da iç kelime dağarcığını hiç görmedi. Sentetik soru üretimi bu açığı tek bir elle yazılmış etiket olmadan kapatır.
Neden işe yarıyor
- Eğitim çiftleri herkese açık bir benchmark’tan değil, senin corpus’undan geliyor.
- Retriever’ı iyileştirmek pipeline’daki her sorguyu iyileştirir — bir prompt değişikliğinin aksine, birikir.
- Aynı sentetik set, retrieval eval’leri için ground truth olarak yeniden kullanılabilir.