deney · büyüyor

Türkçe soru, İngilizce kod

Çok dilli bir embedder TR düzyazıyı 0.04'ten 0.684'e taşıdı; LLM'in yazdığı açıklamalar MRR'ı 0.93'e çıkardı.

Kullanıcılar Türkçe soruyor; kod, yorumlar ve commit mesajları İngilizce. Metin o köprüyü kurmadıkça bir bi-encoder'da bu boşluğu kapatacak hiçbir şey yok.

TR düzyazı recall@8 — MiniLM4%
TR düzyazı recall@8 — BGE-M368%
TR düzyazı MRR — alt küme, enrichment yok78%
TR düzyazı MRR — alt küme, enriched93%

Birinci adım: çok dilli bir embedder

Tek başına BGE-M3, Türkçe düzyazıyı 0.04'ten 0.684'e taşıdı. Aynı corpus'ta İngilizce düzyazı 0.842'de; yani ~16 puanlık bir fark kaldı.

İkinci adım: eksik metni yaz

Contextual retrieval, koda uygulanmış hâli: dosya başına bir LLM çağrısı, her chunk için 2–3 cümlelik Türkçe bir açıklama döndürüyor. Açıklama yalnızca embed edilen / BM25'e giren metne giriyor — modele gösterilen chunk gerçek kaynak olarak kalıyor. chunk hash'i + model ile cache'leniyor; bir re-index asla iki kez ödemiyor.

Aynı 46 dosya / 423 chunkRecall@8MRRTR düzyazı MRRyanlış weak-match
enrichment yok0.9290.8390.7780.119
enriched (yerel qwen3.5:9b)1.0000.9120.9320.048

Negatifler değişmedi (abstain iki durumda da 0.923) — açıklamalar alakasız sorularda güven üretmedi — ve skor kalibrasyonu yerinden oynamadı.

#multilingual #contextual-retrieval #enrichment

Bu notu beyaz tahtada gör →