ufakzeka-karar: Türkçe Metinler Hakkında Karar Veren Küçük Bir Model
Türkçe metinler hakkında cevap türü ve seçenekleri önceden belli sorulara cevap veren, işlemcide çalışan açık bir karar modeli. Model her seçenek için bir olasılık ve bir “emin değilim” sinyali döndürmektedir. Yazıda modelin nasıl kurulduğu, HakemBench’teki sırası ve zayıf yönleri anlatılmaktadır.
PDFModel (Hugging Face)GitHub reposuModel sayfasıModeli deneyin
- 182.494.466parametre, soru başına tek ileri geçiş
- 0,660HakemBench bileşik puanı, 16 satırlık liderlik tablosunda 7. sıra
- 102,5 mssoru başına medyan süre, Apple M1 işlemcide tek iş parçacığıyla
- Apache-2.0ağırlıklar ve kod
Özet
ufakzeka-karar, Apache-2.0 lisansıyla yayımlanan, 182.494.466 parametreli açık bir Türkçe karar modelidir. Model, bir Türkçe metin hakkında cevap türü önceden belli soruları (verilen seçeneklerden biri, sıralı bir ölçekte bir düzey ya da evet/hayır) metin üretmeden, işlemcide soru başına tek bir ileri geçişle (forward pass) cevaplamakta; her seçenek için bir olasılık ve “emin değilim” sinyali olarak kullanılabilecek bir beklenen hata değeri döndürmektedir. Temel modelimiz ufakzeka-1-base üzerine kurulan modelde her seçenek diğerleri görülmeden puanlandığı için seçeneklerin sırası cevabı değiştirmez.
Model, HakemBench v1.0’ın açık test kümesindeki 16 satırlık liderlik tablosunda 0,660 bileşik puanla (yüzde 95 güven aralığı 0,642 ile 0,677) 7. sıradadır; üstündeki altı model ya API üzerinden sunulmakta ya da milyarlarca parametre içermektedir. Apple M1 işlemcide tek iş parçacığıyla soru başına medyan süresi 102,5 ms’dir. Olasılıkları kalibre etmek için modelle birlikte yayımlanan sıcaklık değeri (temperature scaling), dışarıda tutulan destek sorularında kalibrasyon hatasını 0,036’dan 0,064’e çıkarmaktadır (yayımlanan model bu sorularla sonradan eğitilmiştir); HakemBench’te de modelin güveni doğruluğundan biraz yüksektir.
Yayımlanan model, HakemBench’te puanlanan üç eğitimin sonuncusudur ve sayıları test sonuçlarından bağımsız değildir. İkinci eğitime eklenen veri, ilk eğitimden çıkan modelin test kümesinin tamamında güvenlik bariyeri (guardrail), içerik denetimi ve müşteri desteğinde yaptığı hataları hedeflemiştir. Yayımlanan model ise ikinci eğitimden çıkan modelin test kümesinin tamamındaki güvenlik bariyeri sonuçları görüldükten sonra, verisi ve kodu hazırlanmadan ve eğitimine başlanmadan önce yazılı olarak sabitlenen bir protokole göre eğitilmiştir. Yayımlanan modelin bütün sayıları bu incelemelerden sonra elde edilmiştir; güvenlik bariyeri, içerik denetimi ve müşteri desteği sayıları “test sonuçları görülerek şekillendi” işaretini taşımaktadır. Bütün modeller yalnızca diğer dört kategoride puanlandığında bileşik puanı 0,678’dir ve 16 satır arasında 6. sıradadır.
1. Giriş
Dil modelleri, Türkçe metinler hakkında cevabı sabit bir seçenek kümesinden seçilen kararlar için de kullanılmaktadır; destek talebini yönlendirmek, oltalama mesajını işaretlemek ya da bir yapay zekâ asistanını talimatlarının dışına çıkarmaya çalışan prompt injection saldırısını durdurmak bunlara örnektir. Böyle bir kararda cevap serbest metin değil, verilen seçenekler üzerinde bir olasılık dağılımı olmalıdır. Olasılıklar, emin olunmayan durumların bir kişiye bırakılabileceği kadar iyi kalibre edilmeli, yani seçici otomasyona izin vermeli; metnin kullanıcının makinesinden çıkmaması için model işlemcide çalışabilmelidir. HakemBench’te önde gelen API modelleri bu soruları iyi cevaplamaktadır (4.1. bölüm), ancak her cevap dışarıya yapılan bir çağrıdır ve belirttikleri güven değerlerinin olasılık olarak kullanılmadan önce ölçülmesi gerekir.
Tasarım seçimlerini sınayan deneyler, int8 ölçümleri, harici benchmark sonuçları, dayanıklılık testi istatistikleri ve eğitimlerin kaydı teknik raporda ve model kartında yer almaktadır.
2. Model
Omurga (backbone). Model, ufakzeka-1 için 13,5 milyar token üzerinde ön eğitimden geçirilen ve metni soldan sağa okuyan nedensel dil modeli (causal language model) ufakzeka-1-base üzerine kurulmuştur. Plan, omurgayı çift yönlü bir kodlayıcıya (encoder) dönüştürmek ve dönüştürülmüş modeli ancak önceden sabitlenen dört Türkçe sınıflandırma veri kümesinde makro F1’de nedensel modeli en az 1 puan (0,01) geçerse kullanmaktı. Dönüştürülmüş model 1 milyar tokenlık dönüşümden sonra 0,7578, nedensel model 0,7598 aldığı için nedensel omurga korunmuştur.
Karar katmanı. Girdide metin ve sorudan sonra her seçenek, özel tokenlarla işaretlenmiş bir parça (span) olarak yer almakta; bir seçeneğin puanı, o parçadaki tokenların temsillerinin ortalamasından (mean pooling) hesaplanmaktadır. Seçenekler dikkat mekanizmasında (attention) metni ve soruyu görmekte, birbirini görmemekte ve aynı konum indislerini paylaşmaktadır. Bu yüzden seçeneklerin sırası değiştiğinde olasılıklar, tek geçişte işlenebilecek üst sınır olan on seçeneğe kadar bit düzeyinde aynı kalır; daha fazla seçenekte yalnızca kayan noktalı sayı hesaplarındaki küçük yuvarlama farkları kadar değişebilir. Seçenekleri art arda okuyan ve sıraları karıştırılarak eğitilen bir karar katmanı yaklaşık aynı doğruluğa ulaşmış, ancak yalnızca seçeneklerin sırası değiştirildiğinde soruların yüzde 2,3 ile 2,8’inde cevabını değiştirmiştir.
Amaç fonksiyonu. Üretilmiş eğitim örneklerinde hedef, iki değerlendirici modelin (judge model) olasılık dağılımlarının ortalamasıdır; böylece değerlendiricilerin anlaşamadığı soruların hedefi tek bir cevaba indirgenmemektedir. Kayıp fonksiyonu çapraz entropidir; derecelendirme sorularında buna sıralı olasılık puanı (ranked probability score) eklenmiştir. Pekiştirmeli öğrenme (reinforcement learning) kullanılmamıştır; aynı katman ve veriyle denenen REINFORCE ise eğitimde görülmemiş sorularda makro F1’i 10,2 puan düşürmüş (yüzde 95 güven aralığı 6,2 ile 13,5 puan) ve bütün kalibrasyon ölçülerinde daha kötü sonuç vermiştir.
Kalibrasyon ve “emin değilim”. Eğitimden sonra doğrulama örneklerinde tek bir sıcaklık değeri belirlenmiştir (1,2614). “Emin değilim” sinyali, modelin verdiği en yüksek olasılığa karşılık gelen ve yine doğrulama verisinde belirlenen beklenen hata oranıdır. Kalibrasyon hatası olarak, verilen olasılık ile gerçek doğruluk arasındaki farkı olasılıkları sabit dilimlere (bin) ayırmadan ölçen düzgünleştirilmiş beklenen kalibrasyon hatası (smooth ECE) kullanılmaktadır.
Yayımlanan dosya. Model 32 bitlik kayan noktalı sayı (fp32) formatında yayımlanmaktadır. Plan, 8 bitlik tamsayılara kuantize edilmiş (int8) bir dosyayı yalnızca makro F1’de ve kalibrasyon hatasında fp32 dosyasından en fazla 0,5 puan uzaklaşırsa yayımlamaktı. Daha önceki bir kontrol noktasından üretilen int8 dosyaları kalibrasyon hatasını en fazla 0,11 puan değiştirmiş, ancak makro F1’i 0,67 ile 1,61 puan düşürmüştür; bu yüzden int8 dosyası yayımlanmamıştır.
3. Eğitim verisi
Eğitim verisi yalnızca Apache-2.0, MIT, CC0, CC BY 2.0 ya da CC BY 4.0 lisanslı kaynaklardan veya proje için yazdırılan metinlerden gelmektedir. Bu kaynakların bir kısmında lisans yalnızca veri kümesini kapsamakta, içindeki metinlerin hakları ise yazarlarında ya da ilgili sitelerde kalmaktadır; ayrıntılar model kartında ve teknik raporda yer almaktadır. Karışımın bir kısmı, cevap türü önceden belli sorulara dönüştürülmüş etiketli veri kümelerinden (yalnızca eğitim bölümleri) oluşmaktadır. Ayrıca 5.489 gerçek Türkçe SSS metni üzerinde sorular üretilmiş, bunları iki model ailesinden iki değerlendirici model etiketlemiştir. Lisanslı, insan etiketli Türkçe veri kümesi bulunamayan kategorilerde metinleri iki model yazmış, her metni, onu yazan model dışındaki iki değerlendirici model etiketlemiştir; içerik denetimi verisine de proje için yazdırılan yorumlar eklenmiştir. Test verisinin eğitime karışmaması için her dosya 70 değerlendirme veri kümesiyle ve HakemBench’in bütün metinleri ve dayanıklılık testleriyle karşılaştırılmış, eşleşen satırlar çıkarılmıştır.
Yayımlanan model 55.679 eğitim örneği üzerinde, bir NVIDIA H200’de 2 epoch boyunca eğitilmiştir. Kontrol noktaları, elle cevaplanmış ve test kümesinden ayrı tutulmuş 255 destek sorusundan oluşan geliştirme kümesine göre seçilmiştir. Bu yazıdaki insan cevaplarının hepsi tek bir kişiye aittir; tek bir etiketleyici de hata yapabilir, bu yüzden bu cevaplara dayanan sayılar yol gösterici niteliktedir.
Eğitim havuzundaki 2.697 gerçek SSS metninde HakemBench’in dört destek sorusu da sorulduğu için müşteri desteği kategorisi artık bir genelleme testi değildir. Bu metinleri, benchmark’ın destek sorularındaki altın standart etiketleri (benchmark’ın doğru kabul ettiği cevapları) belirleyen yapay zekâ modeli ailesi aynı yönergeye göre etiketlediği için destek puanı kısmen modelin etiketleyicisiyle ne kadar uyuştuğunu ölçmektedir. Yeni yazdırılan 1.499 içerik denetimi yorumu da, açık test kümesindeki içerik denetimi metinlerinin tamamını oluşturan, benchmark için yazdırılmış metinlere benzemektedir. Bu yorumlarla eğitilen bir karakter n-gram sınıflandırıcısı o metinlerde 0,926, web kaynaklı içerik denetimi metinlerinde ise 0,401 dengeli doğruluğa (balanced accuracy) ulaşmıştır; bu yüzden modelin içerik denetimi sonucu olduğundan yüksek görünebilir.
4. Sonuçlar
Aksi belirtilmedikçe bu bölümdeki sayılar HakemBench v1.0’ın açık test kümesinde (yedi kategoride 2.346 metin ve 4.275 soru) ölçülmüştür. Yayımlanan modelin bütün sayıları, test kümesinin tamamındaki sonuçlar iki kez incelendikten sonra elde edilmiştir (5. bölüm). Bu yüzden güvenlik bariyeri, içerik denetimi ve müşteri desteği sayıları “test sonuçları görülerek şekillendi” işaretini taşımaktadır; bütün modeller yalnızca diğer dört kategoride puanlandığında bileşik puanı 0,678’dir ve 16 satır arasında 6. sıradadır.
4.1 Liderlik tablosu
Bileşik puan, karar kalitesi (kategori başına makro F1), kalibrasyon (1 eksi normalize edilmiş Brier skoru) ve seçici otomasyon (1 eksi normalize edilmiş risk-kapsama eğrisi altındaki alan) eksenlerinin eşit ağırlıklı geometrik ortalamasıdır. Köşeli parantez içindeki değerler, metinlerin yerine koymalı olarak 2.000 kez yeniden örneklenmesiyle (bootstrap yöntemi) hesaplanan yüzde 95 güven aralıklarıdır. Aşağıdaki tabloda liderlik tablosunun ilk dokuz satırı yer almaktadır; 16 satırın tamamı HakemBench yazısında bulunmaktadır. Karşılaştırma için, metni anlamadan yalnızca uzunluk, rakam ya da soru işareti gibi yüzeysel özelliklere bakan basit bir referans model (baseline) olan yüzeysel ipucu modeli 0,272 bileşik puanla 13. sıradadır.
| Sıra | Model | Bileşik puan | Karar kalitesi | Kalibrasyon | Seçici otomasyon |
|---|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | 0,888 [0,876; 0,898] | 0,901 | 0,806 | 0,964 |
| 2 | GPT-5.6 Sol | 0,842 [0,827; 0,856] | 0,871 | 0,727 | 0,943 |
| 3 | GLM 5.3 | 0,827 [0,813; 0,839] | 0,855 | 0,706 | 0,936 |
| 4 | Jev 1.13 | 0,825 [0,811; 0,837] | 0,851 | 0,706 | 0,935 |
| 5 | jaredpalmer/kev-4b | 0,688 [0,673; 0,702] | 0,747 | 0,503 | 0,866 |
| 6 | jaredpalmer/kev-9b | 0,666 [0,647; 0,683] | 0,725 | 0,478 | 0,852 |
| 7 | ufakzeka-karar | 0,660 [0,642; 0,677] | 0,705 | 0,482 | 0,848 |
| 8 | Qwen/Qwen3.5-4B | 0,653 [0,629; 0,674] | 0,741 | 0,438 | 0,857 |
| 9 | DeepSeek V4 Pro | 0,633 [0,606; 0,658] | 0,761 | 0,386 | 0,862 |
API üzerinden sunulan sohbet modellerinden üçü (Gemini 3.8 Flash, GPT-5.6 Sol, GLM 5.3) ile karar API’si Jev 1.13 açıkça öndedir. Tabloda adıyla yer alan bazı API modelleri, benchmark verisinin bir bölümünü yazan ya da etiketleyen modellerle aynı ailedendir (HakemBench yazısı). Beşinci ile dokuzuncu sıradaki modellerin güven aralıkları ufakzeka-karar’ınkiyle örtüştüğü için bu aralıktaki sıralama kesin değildir. Yüzeysel ipucu modeli ise metni okumaz; her soruyu, benchmark’ın iki bölümünden biri olan A bölümünde belirlenen tek bir yüzeysel ipucuna (cevabın uzunluğu, bir rakam ya da soru işareti gibi) göre cevaplar.
Toplam 209 soruda, yani 181 mahkeme metni ile kaynak veri kümelerinden gelen 28 güvenlik bariyeri metninde, diğer modeller hiç örnek görmeden (sıfır atışlı, zero-shot) cevap verirken ufakzeka-karar aynı veri kümelerinin eğitim bölümleriyle eğitilmiştir (mahkeme metinlerinde 3.000 satır; güvenlik bariyerinde, bu 28 metnin geldiği iki veri kümesini de içeren üç prompt injection veri kümesinden 1.791 satır; yakın kopyalar çıkarılmıştır). Hukuki yönlendirme puanı ve güvenlik bariyeri sayıları buna göre okunmalıdır.
Apple M1 işlemcide PyTorch’ta tek iş parçacığıyla, 13 örnek soruda soru başına medyan süre 102,5 ms, en yüksek bellek kullanımı 986.038.272 bayt olarak ölçülmüştür (tek bir makinedeki ölçümdür, genel bir hız testi değildir).
4.2 Kategorilere göre
Kalibrasyon hatasında düşük değer daha iyidir. Yıldızla (*) işaretli kategorilerde eğitim verisi, test sonuçları görülerek şekillenmiştir (5. bölüm).
| Kategori | Soru sayısı | Doğruluk | Makro F1 | Kalibrasyon hatası |
|---|---|---|---|---|
| Doğruluk kontrolü önceliklendirmesi | 602 | 0,640 | 0,437 | 0,037 |
| Eğitim | 640 | 0,787 | 0,802 | 0,025 |
| Güvenlik bariyeri* | 418 | 0,770 | 0,764 | 0,158 |
| Hukuki yönlendirme | 308 | 0,782 | 0,754 | 0,056 |
| İçerik denetimi* | 353 | 0,952 | 0,951 | 0,084 |
| Spam ve oltalama | 614 | 0,806 | 0,746 | 0,035 |
| Müşteri desteği* | 1.340 | 0,569 | 0,479 | 0,069 |
Tablodaki her kategori birden fazla soru türünü bir araya getirir. Soru türlerine bakıldığında en zayıf sonuçlar, müşteri desteğinin 670 seçim ve 335 derecelendirme sorusunda (doğruluk 0,490 ve 0,481; ipucunu bu soruların bir kısmını da içeren A bölümünde öğrenen yüzeysel ipucu modeli burada 0,516 ve 0,507 almaktadır) ve doğruluk kontrolü önceliklendirmesinin kontrolün ne kadar öncelikli olduğunu soran 300 sorusundadır (doğruluk 0,500; kategorinin tamamında 0,640). Güvenlik bariyerinde model 217 saldırının 194’ünü yakalamakta, ancak saldırıya benzeyen 201 zararsız mesajın yalnızca 128’ini geçirmektedir. İçerik denetimindeki 0,952 değeri, 3. bölümde anlatılan üslup benzerliği nedeniyle temkinle okunmalıdır.
4.3 Kalibrasyon ve “emin değilim” sinyali
Sıcaklıkla ölçekleme, ilk eğitimde dışarıda tutulan dört destek sorusunda (HakemBench’in her destek metnine sorduğu dört soru) kalibrasyonu kötüleştirmektedir; HakemBench’te puanlanan ilk eğitimden çıkan ve bu sorularla hiç eğitilmemiş modelde, o modelin kendi sıcaklık değeri kalibrasyon hatasını 0,027’den 0,045’e çıkarmıştır. Yayımlanan model bu dört soruyla sonradan eğitildiği için aynı kümede hatasının 0,036’dan 0,064’e çıkması, görülmemiş sorular için bir test sayılmamaktadır. Geliştirme kümesinde ise hata 0,050’den 0,038’e düşmüştür. A bölümünde sonradan belirlenen sıcaklık değerinin 1’den büyük olması (1,1733), modelin HakemBench’te hâlâ biraz aşırı emin olduğunu göstermektedir.
Güven, 1 eksi “emin değilim” değeridir. Güveni 0,90 ya da üstünde olan cevaplar 4.275 sorunun 1.248’ini kapsamakta ve bu cevaplardaki hata oranı 0,062’dir. Sinyal ise güvenlik bariyeri hatalarını kaçırmaktadır; güveni 0,99 ya da üstünde olan 213 cevabın 148’i güvenlik bariyeri cevabıdır ve bunların yüzde 12’si yanlıştır. Müşteri desteğinde 1.340 cevabın yalnızca 6’sının güveni 0,90 ya da üstündedir.
4.4 İnsan cevaplarıyla karşılaştırma
Elle cevaplanan 84 destek sorusunda (insan denetimi) modelin doğruluğu 0,476 [0,369; 0,583] olup yüzeysel ipucu modelinin 0,619 [0,512; 0,714] değerinin altında kalmaktadır; öndeki dört modelin buradaki doğruluğu 0,738 ile 0,786 arasındadır.
5. Modelin geliştirilme süreci
Yayımlanan model, HakemBench’te puanlanan üç eğitimin sonuncusudur (bileşik puanlar açık test kümesinde sırasıyla 0,556; 0,645 ve 0,660) ve sayıları test sonuçlarından bağımsız değildir. İlk eğitimde dört destek sorusu, genellemeyi ölçmek için eğitim verisinin dışında tutulmuştur. İkinci eğitime, ilk eğitimden çıkan modelin test kümesinin tamamında güvenlik bariyeri, içerik denetimi ve müşteri desteğinde yaptığı hataları hedefleyen veri, yani 3. bölümdeki metinler ve 800 zararsız güvenlik bariyeri mesajı eklenmiş, ancak metinleri yazan modelin güvenlik filtresi bu yöndeki isteklerin hepsini reddettiği için gerçekçi saldırı mesajları yazdırılamamıştır. Bu eğitimden çıkan model, büyük olasılıkla eğitimdeki güvenlik bariyeri metinlerinden gerçek bir kullanıcı mesajı gibi okunanların hepsi zararsız olduğu için bir kısayol öğrenmiş; saldırıya benzeyen 201 zararsız mesajın 195’ini geçirirken 217 saldırının yalnızca 106’sını yakalamıştır. Doğrulama kümesindeki kabul testi, prompt injection örnekleri eğitimdeki saldırılarla aynı kümelerden geldiği için bunu yakalayamamıştır.
Yayımlanan model ise ikinci eğitimden çıkan modelin test kümesinin tamamındaki güvenlik bariyeri sonuçları görüldükten sonra, verisi ve kodu hazırlanmadan ve eğitimine başlanmadan önce yazılı olarak sabitlenen bir protokole göre eğitilmiştir. Eğitime, metinlerini bir modelin yazdığı turkish-conversation-prompt-injection veri kümesinden sohbet biçiminde saldırı ve zararsız mesajlar eklenmiş, kümenin bir kısmı da güvenlik bariyeri geliştirme kümesi olarak ayrılmıştır. Yayımlanan varyant ayrıca ikinci eğitime eklenen zararsız mesajlar olmadan eğitilmiştir. Protokoldeki altı eğitimden (iki varyant, üçer rastgele tohum) çıkan modellerin dördü güvenlik bariyeri geliştirme kümesindeki saldırıların en az yüzde 80’ini yakalamış, bunlar arasından 3. bölümdeki geliştirme kümesinde makro F1’i en yüksek olan yayımlanmak üzere seçilmiş, test kümesinde bir kez puanlanmış ve sonrasında hiçbir ayar yapılmamıştır. Seçim kuralı ve sonucu kodla birlikte yayımlanmaktadır. Güvenlik bariyeri, içerik denetimi ve müşteri desteği sayıları “test sonuçları görülerek şekillendi” işaretini taşımaktadır; bütün modeller yalnızca diğer dört kategoride puanlandığında bileşik puanı 0,678’dir ve 16 satır arasında 6. sıradadır.
6. Sınırlar
- Sayıları test sonuçlarından bağımsız değildir. Önceki eğitimlerden çıkan modellerin test sonuçları eğitim verisini şekillendirdiği için güvenlik bariyeri, içerik denetimi ve müşteri desteği kategorilerindeki sayılar işaretlenmiştir. Ayrıca 209 soru, eğitim bölümleri eğitim verisinde yer alan veri kümelerinden gelmektedir (4.1. bölüm).
- Güvenlik bariyerinde yanlış alarm vermektedir. Zararsız mesajların bir kısmını saldırı olarak işaretlemektedir; “emin değilim” sinyali de bu kategorideki hataları yakalayamamaktadır (4.2. ve 4.3. bölümler).
- Yayımlanan sıcaklık değeri kalibrasyonu her veride iyileştirmemektedir. Bazı verilerde kalibrasyon hatasını düşürürken bazılarında artırmaktadır (4.3. bölüm).
- Elle cevaplanmış küçük bir kümede yüzeysel ipucu modelinin gerisinde kalmaktadır. Bu kümedeki 84 destek sorusunda modelin doğruluğu 0,476, yüzeysel ipucu modelininki ise 0,619’dur (4.4. bölüm).
- İnsan cevaplarının hepsi tek bir kişiye aittir. Bu nedenle etiketleyiciler arası uyum ölçülememiştir.
- İçerik denetimindeki sonucu olduğundan yüksek görünebilir (3. bölüm).
- Dünya bilgisi zayıftır. Bir bilgi sınavı olan MMLU-Pro-TR’de doğruluğu 0,098 [0,092; 0,103] olup şans düzeyinin (0,111) biraz altında kalmaktadır.
- Yalnızca Türkçe için eğitilmiştir ve yalnızca fp32 formatında yayımlanmaktadır. Metin ile soru birlikte 448 tokenı aşarsa metnin sonu okunmaz.
7. Maliyet
Projenin maliyeti, GPU süresi ve API üzerinden sunulan modellere yapılan çağrılar için toplam 236,90 dolardır (Modal’da 181,55 dolar, API çağrılarında 55,35 dolar). Temel model ufakzeka-1 (maliyeti kendi yazısında raporlanmıştır), sunucu ve geliştirme sırasında kullanılan yapay zekâ modeli bu rakama dâhil değildir. Tutar, model ile HakemBench’i birlikte kapsamaktadır ve hizmet sağlayıcıların hesap panellerinden okunmuştur.
Erişim
Model Hugging Face ve GitHub üzerinde bulunmakta, karar.ufakzeka.com adresinde denenebilmektedir; model sayfası ufakzeka.com/ufakzeka-karar adresindedir. Öneri ya da sorun bildirmek için hello@ufakai.com adresine yazabilirsiniz.