Kısa cevap: Fine-tuning, önceden eğitilmiş bir dil modelini kendi örnekleriniz üzerinde ek eğitimden geçirerek ona belirli bir davranışı — üslup, format, alan terminolojisi, görev refleksi — kazandırma sürecidir. Bilgi eklemek için değil, davranış öğretmek için kullanılır; modele güncel gerçekleri ezberletmenin güvenilir yolu değildir. Doğru sıralama neredeyse her projede aynıdır: önce prompt mühendisliği, sonra RAG, en son fine-tuning.
2026'nın çelişkili gerçeği şu: fine-tuning hiç olmadığı kadar erişilebilir ve hiç olmadığı kadar az gerekli. Erişilebilir, çünkü güçlü açık modeller (Llama, Qwen, Mistral aileleri) ve LoRA gibi verimli yöntemler eğitimi mütevazı donanıma indirdi. Az gerekli, çünkü hazır modeller o kadar iyileşti ki eskiden ek eğitim isteyen birçok iş artık iyi bir talimatla çözülüyor. Bu yazı iki soruya cevap verir: gerçekten ne zaman gerekir ve gerektiğinde nasıl doğru yapılır.
Ne Zaman Fine-Tuning?
Dört meşru gerekçe var. (1) **Kararlı format zorunluluğu:** çıktının her seferinde aynı yapıda olması gereken işler — talimatla yaklaşırsınız ama binlerce üretimde tutarlılığı eğitim verir. (2) **Alan jargonu:** sektörünüze özgü dil kullanımının talimatla taşınamayacak kadar derin olduğu durumlar. (3) **Gecikme ve sorgu maliyeti:** eğitilmiş model uzun talimat ve örnek yığını olmadan çalışır; milyonlarca sorguda kısa prompt ciddi ekonomik fark yaratır. (4) **Görev damıtma (distillation):** büyük bir modelin çıktılarıyla küçük bir açık modeli eğitip aynı dar görevi çok daha ucuza yaptırmak — 2026'da fine-tuning'in ekonomik olarak en güçlü gerekçesi budur. Listede olmayan şeye dikkat: 'modele bilgimizi öğretmek' — o iş [RAG](/kaynaklar/rag-vs-fine-tuning) işidir.
Veri Hazırlığı: Asıl İş Burada
Sahada tekrar tekrar gördüğümüz gerçek: fine-tuning'in başarısını model seçimi değil, veri seti belirliyor. Çoğu model talimat-cevap çiftleri bekler: bir görev tanımı, bir girdi, bir de olması gereken çıktı. Örnek: talimat 'Bu müşteri şikâyetini tek cümleyle özetle', girdi şikâyet metni, çıktı ise sizin onayladığınız ideal özet. Modelin öğreneceği şey tam olarak bu çiftlerin içindeki desendir — veri setinizde olmayan davranışı model kazanmaz, veri setinizdeki hatayı ise sadakatle kopyalar.
Miktar ve kalite dengesi: yüzlerce özenli örnek, binlerce vasat örneği yener. Üç pratik kural: her örneği en az bir insan gözü görmeli; çeşitlilik sayıdan önemlidir — kolay vakalarla dolu bir set, zor vakalarda çuvallayan model üretir; sentetik (başka bir modele ürettirilmiş) veri kullanacaksanız insan süzgecinden geçirmeden eğitime sokmayın. Kişisel veri içeren örnekleri de eğitimden önce anonimleştirin — ağırlıklara gömülen veri, KVKK açısından silinmesi en zor veridir.
Yöntemler: Full, LoRA, QLoRA
**Full fine-tuning:** modelin tüm ağırlıkları güncellenir. En yüksek kapasite, en yüksek donanım maliyeti ve en yüksek risk — modelin genel yeteneklerini bozma ihtimali de en fazladır. **LoRA (Low-Rank Adaptation):** ana model dondurulur, yanına küçük adaptör katmanları eklenir ve yalnız onlar eğitilir. Bellek ihtiyacı kat kat düşer; adaptörler takılıp çıkarılabilir — aynı taban modelin üstünde farklı görevler için farklı adaptörler tutabilirsiniz. **QLoRA:** LoRA artı nicemleme (quantization — ağırlıkları düşük hassasiyetli sayılara sıkıştırma); büyük modelleri tek tüketici GPU'sunda bile eğitilebilir kılar. Varsayılan tercih LoRA olmalı: ucuz, geri alınabilir ve unutma riskini azaltır. Full fine-tuning'i, LoRA'nın yetmediğini ölçerek kanıtladıysanız düşünün.
Süreç: Altı Adım
(1) **Taban model seçimi** — lisansı ticari kullanıma uygun, boyutu donanımınıza uygun bir açık model; seçim kriterleri için [açık kaynak LLM yazımıza](/kaynaklar/acik-kaynak-llm) bakın. (2) **Veri hazırlığı** — yukarıdaki bölüm; sürenin yarısından fazlasını burada geçirmek normaldir. (3) **Eğitim yapılandırması** — düşük öğrenme hızı, az sayıda tur (epoch); fazlası ezberletir. (4) **Eğitim** — LoRA ile çoğu kurumsal veri setinde saatler mertebesinde iştir. (5) **Değerlendirme** — aşağıda ayrı bölüm; atlanma şampiyonu adım budur. (6) **Dağıtım** — üretim servisi için vLLM gibi bir çıkarım sunucusu; eğitilen adaptörü, veri setini ve yapılandırmayı birlikte versiyonlayın.
Değerlendirme: En Çok Atlanan Adım
Eğitim bitince 'birkaç soru sorup beğenmek' değerlendirme değildir. Üç katmanlı ölçüm gerekir. Birincisi, eğitimde hiç kullanılmamış bir test setinde görev başarısı — eğitim verisiyle test etmek kendinizi kandırmaktır. İkincisi, körleme karşılaştırma: aynı girdiler eski ve yeni modele verilir, değerlendiren kişi hangisinin hangisi olduğunu bilmez; bilirse yeni modeli kayırır, bu ölçülmüş bir insan zaafıdır. Üçüncüsü, gerileme kontrolü: model asıl görevde iyileşirken genel yeteneklerini (akıl yürütme, dil düzgünlüğü) kaybetmiş olabilir — birkaç genel görevle bunu da yoklayın.
Riskler
Dört risk bilinçli yönetim ister. **Aşırı öğrenme (overfitting):** model eğitim örneklerini ezberler, yeni girdilerde genelleyemez; panzehir az tur, çeşitli veri ve ayrı test setidir. **Felaket unutma (catastrophic forgetting):** dar göreve odaklanan model genel yeteneklerini kaybeder; LoRA bu riski azaltır çünkü ana ağırlıklar dokunulmadan kalır. **Veri sızıntısı:** test örneklerinin eğitime karışması sonuçları yapay şişirir — seti eğitimden önce ayırın, sonra değil. **Gizlilik sızıntısı:** eğitim verisindeki hassas bilgi modelin çıktılarında geri belirebilir; kişisel veriyi eğitime sokmamak, sonradan temizlemeye çalışmaktan her zaman ucuzdur.
Sahada işe yarayan ipuçları
**1.** 'Gerçekten gerekli mi' testini yapın: en zor 20 örneğinizi iyi bir sistem talimatı ve birkaç örnekle mevcut modele verin; sonuç hedefe yakınsa durun — fine-tuning'in getireceği fark, taşıyacağı operasyon yükünü ödemez. **2.** Veri setini gerçek işten toplayın: onaylanmış geçmiş cevaplar, düzeltilmiş taslaklar, beğenilen çıktılar — masa başında yazılmış örnekler gerçek dağılımı temsil etmez, model sınıfta iyi sahada kötü olur. **3.** LoRA ile başlayın ve tek değişkenle ilerleyin: aynı anda model, veri ve yapılandırma değiştirirseniz neyin işe yaradığını öğrenemezsiniz. **4.** Üç metriği birlikte izleyin — görev başarısı, genel yetenek, format uyumu; tek metriğe optimize edilen model, ölçülmeyen eksende sessizce bozulur. **5.** Her şeyi versiyonlayın: veri seti, eğitim yapılandırması ve adaptör birlikte arşivlenmezse sonucu ne tekrarlayabilir ne hatayı geri izleyebilirsiniz — bu kayıt, ÇŞS (Çalışma Şeffaflığı Sözleşmesi) disiplinindeki karar izinin mühendislik karşılığıdır.
Sık yapılan hatalar
En yaygın hata, fine-tuning'i bilgi deposu gibi kullanmak: ürün kataloğunu modele 'öğretip' her güncellemede yeniden eğitmek — pahalı, kırılgan ve gereksiz; o iş retrieval katmanının işidir. İkincisi, değerlendirmeyi hisle yapmak: körleme test olmadan 'daha iyi görünüyor' demek. Üçüncüsü, bir kez eğitip unutmak: görev dağılımı zamanla kayar, modelin performansı sessizce aşınır — çeyreklik yeniden değerlendirme takvimi şart. Dürüst bir saha notu: fine-tuning diye başlayan işlerin önemli bölümü, keşif aşamasında daha iyi bir prompt veya RAG ile kapanıyor. Bu başarısızlık değil — doğru sıralamanın çalışması.
Taban model seçimi bu sürecin ilk ve en bağlayıcı kararı — lisans, boyut ve Türkçe performans kriterlerini [Açık Kaynak LLM Modelleri](/kaynaklar/acik-kaynak-llm) yazısında işledik. Fine-tuning ile RAG arasındaki iş bölümünü netleştirmek içinse [RAG vs Fine-Tuning](/kaynaklar/rag-vs-fine-tuning) karar çerçevesi sunar.