Projeler
İki model ve bir benchmark geliştirdik. Üçü de Türkçe için hazırlanmıştır ve açıktır. Her biri, ölçüm sonuçları ve bulduğumuz sınırlarla birlikte yayımlanmaktadır.
Sohbet modeli, Eylül 2026
ufakzeka-1
Açık lisanslı 13,5 milyar tokenla sıfırdan eğitilen, ardından sohbet için ince ayarlanan 151M parametreli bir Türkçe dil modelidir. Daha büyük Türkçe modellerle tek bir ölçüm düzeneğinde karşılaştırıldı; yanlış yaptıkları (uydurulan bilgiler, ikinci turda bozulan aritmetik, ezberlenen eğitim örnekleri) sayılarıyla model kartına yazıldı. Toplam maliyet 300 doların altında. Apache-2.0.
Karar modeli, Ekim 2026
ufakzeka-karar
ufakzeka-karar, ufakzeka-1-base üzerine kurulan, 182.494.466 parametreli Türkçe bir karar modelidir. Bir metni ve o metin hakkında sorulan bir soruyu okur; sorunun cevap türü ve seçenekleri önceden bellidir. Sorunun türüne göre seçeneklerden birini seçer, bir ölçekte bir düzey verir ya da evet veya hayır der; bütün seçeneklerin olasılıklarını tek seferde hesaplar. Yanılma olasılığını da tahmin ettiği için emin olmadığı sorular bir kişiye bırakılabilir.
Seçenekler birbirini görmeden puanlanır, bu yüzden sıraları cevabı değiştiremez. Model GPU gerektirmeden sıradan bir işlemcide çalışır; Apple M1 işlemcili bir bilgisayarda tek iş parçacığıyla yapılan ölçümde soru başına medyan süre 102,5 ms’dir. Apache-2.0 lisansıyla yayımlanmaktadır.
- HakemBench’teki en güçlü model değildir. 16 satırlık liderlik tablosunda 0,660 bileşik puanla (yüzde 95 güven aralığı 0,642 ile 0,677) 7. sıradadır; Gemini 3.8 Flash, GPT-5.6 Sol, GLM 5.3, Jev 1.13, Kev 4B ve Kev 9B daha yüksek puan almaktadır. En iyi satırın puanı 0,888’dir.
- Model, benchmark’taki dört destek sorusuyla eğitilmiştir; ancak eğitimdeki sorular benchmark’takilerden farklı metinler hakkındadır. Benchmark’taki 209 hukuki yönlendirme ve güvenlik bariyeri sorusunun alındığı veri kümelerinin eğitim bölümleri de modelin eğitim verisindedir; diğer modeller bu sorulara hiç örnek görmeden (sıfır atışlı) cevap vermiştir. Araştırma yazısında bu durum ve geliştirme sırasında ortaya çıkan bir kısayol anlatılmaktadır.
- Yayımlanan model, HakemBench’te puanlanan üç eğitimin sonuncusudur ve sayıları test sonuçlarından bağımsız değildir. Önceki eğitimlerden çıkan modellerin test sonuçları eğitim verisini şekillendirdiği için güvenlik bariyeri, içerik denetimi ve müşteri desteği sayıları işaretlidir. Bütün modeller yalnızca diğer dört kategoride puanlandığında bileşik puanı 0,678’dir ve 16 satır arasında 6. sıradadır.
- Olasılıkları kalibre etmek için modelle birlikte yayımlanan sıcaklık değeri (temperature scaling), dışarıda tutulan destek sorularında kalibrasyon hatasını 0,036’dan 0,064’e çıkarmaktadır; yayımlanan model bu sorularla sonradan eğitilmiştir. HakemBench’te model bir miktar aşırı emindir.
- “Emin değilim” sinyali güvenlik bariyeri hatalarını kaçırır. Bir mesajın, yapay zekâ asistanını talimatlarının dışına çıkarmaya çalışan bir prompt injection saldırısı olup olmadığını soran güvenlik bariyeri sorularında modelin 0,99 ya da daha yüksek güvenle verdiği cevapların yüzde 12’si yanlıştır; müşteri desteğinde ise neredeyse hiçbir cevabın güveni 0,90’a ulaşmaz. Bu sayılar da işaretli sayılar arasındadır.
Benchmark, Ekim 2026
HakemBench
HakemBench, modellerin Türkçe metinler hakkında bir hakem gibi verdiği kararları ölçen bir benchmark’tır; adı da buradan gelmektedir. Her sorunun cevap türü ve seçenekleri önceden bellidir. Yedi kategorideki 2.346 metin üzerinde 4.275 soru içermektedir. Kategoriler doğruluk kontrolü önceliklendirmesi, eğitim (öğrenci cevaplarının puanlanması), içerik denetimi, hukuki yönlendirme, spam ve oltalama, güvenlik bariyeri ile müşteri desteğidir. 26 Eylül 2026’da dondurulan 1.0 sürümü tamamen açıktır; yayımlanan bütün metinler, altın standart etiketleri (benchmark’ın doğru kabul ettiği cevaplar) ve dayanıklılık testleriyle birlikte herkesin erişimine sunulmaktadır. Her metinde ve dayanıklılık testi dosyalarındaki her metin satırında bulunan canary string (metni eğitim verisinden ayıklamaya yarayan sabit bir işaret dizesi), eğitim verisi hazırlayanların bu metinleri ayıklamasını sağlamaktadır.
Bütün modeller aynı değerlendirme koduyla karar kalitesi (makro F1), kalibrasyon ve seçici otomasyon açısından, yeniden örneklemeyle (bootstrap) hesaplanan güven aralıklarıyla puanlanmaktadır. Seçici otomasyon, modelin emin olduğu cevapları kendisinin verip gerisini bir kişiye bırakabilmesini ölçer. Dayanıklılık testlerinin çalıştırıldığı modellerde ayrıca seçeneklerin sırası değiştiğinde, metin başka sözcüklerle anlatıldığında ya da metindeki adlar değiştirildiğinde cevabın ne kadar oynadığı ölçülmektedir.
- Liderlik tablosunda yalnızca bizim test ettiğimiz modeller yer almaktadır; herkes değerlendirme kodunu çalıştırıp kendi sonuçlarını yayımlayabilir.
- Altın standart etiketlerin çoğu tek bir yapay zekâ modeli ailesinin etiketleme turlarından gelmektedir. Bu etiketler, başka iki model ailesine ait büyük dil modellerinden oluşan bir kurulun oylarıyla karşılaştırılmış, uyuşmazlıkların çoğunu yine aynı aile çözmüştür. Altın standart etiketler insan doğrulamasından geçmemiştir.
- Benchmark için yazdırılan metinler, üzerlerinde telif hakkı doğduğu ölçüde CC BY 4.0, aksi hâlde CC0 lisanslıdır. Kaynak veri kümeleri kendi lisanslarını korumaktadır. Değerlendirme kodu Apache-2.0 lisanslıdır.