YAPAY ZEKÂ MODELLERİ / KARŞILAŞTIRMA

DeepSeek V4 Pro vs Kimi K3: metin, resimler ve muhakeme

Bir raporu analiz etmeniz, kodu açıklamanız veya ekran görüntüsünü okumanız mı gerekiyor? DeepSeek V4 Pro ve Kimi K3, ilk adımınızı etkileyecek şekilde farklılık gösterir: okuyabilecekleri materyalin türü. Cevaplarını karşılaştırmadan önce buradan başlayın.

Bir bakışta karşılaştırma
SoruDeepSeek V4 ProKimi K3
Sağlayıcı referansıDeepSeek V4 Pro API listelemeMoonshot AI Kimi K3 deposu
Görüntü anlamaAlıntı yapılan Pro API listesinde desteklenmiyorYerel vizyon belgelendi
Karşılaştırılacak metin göreviKanıtları çıkarın ve hesaplamaları kontrol edinKanıtları çıkarın ve hesaplamaları kontrol edin
GO AI Web'deki adDeepSeekKimi

Skor tablosuyla değil, girdiyle başlayın

DeepSeek, V4 Pro için düşünme ve düşünme dışı modları listeler ve görmeyi desteklenmiyor olarak işaretler. Moonshot, Kimi K3'yi yerel görsel anlayışa sahip bir model olarak tanımlıyor. Bu gerçekler uyumlu bir görevin seçilmesine yardımcı olur, ancak hangisinin belgelerinize daha doğru yanıt vereceğini belirlemez.

Kaynağınız ekran görüntüsü ise seçilen model için görüntü girişini destekleyen bir arayüz kullanın. Ekran görüntüsünü metne dönüştürürseniz, önce transkripsiyonu inceleyin: Eksik bir eksi işareti veya tablo sütunu, her iki model başlamadan önce cevabı değiştirebilir.

DeepSeek: model details · Moonshot AI: Kimi K3

Test 1: iddiaları kanıtlarla çıkarın

Hem onaylanmış gerçekleri hem de tahminleri içeren kısa bir rapor kullanın. Bir iddia tablosu, kesin deliller ve belirsizlikler isteyin. Sağlanan metinde desteği olmayan iddiaları reddedin.

Sadece çok sayıda satır ürettiğiniz için puan vermeyin. Altı doğru gerçeği ortaya koyan bir cevap, tahmin içeren on iki satırdan daha yararlı olabilir. "Beklenen" ve "onaya tabi" gibi niteliklerin geçerli olup olmadığını kontrol edin.

İSTEM 01
Yalnızca bu raporu oku: [metin]. Her iddiayı, onu destekleyen birebir alıntıyı ve durumunu içeren bir tablo oluştur: doğrulanmış bilgi, öngörü veya belirsiz bilgi. Dış kaynaklardan bilgi ekleme. Ardından çelişkileri ve eksik bilgileri listele; boşlukları tahminle doldurma.

Test 2: cevap anahtarıyla hesaplama

Kendiniz doğrulayabileceğiniz küçük bir örnek seçin. Bir ekibin her biri sekiz katılımcıyla dört oturum planladığını ve ardından bir oturumu iptal ettiğini varsayalım. Geriye kalan toplam 24 katılımcı yeridir, mutlaka 24 benzersiz kişi olması gerekmez. Bu ayrım yararlı bir muhakeme kontrolü sağlar.

Her modelden aritmetiğini göstermesini ve sayıların ne anlama geldiğini belirtmesini isteyin. Hem hesaplamayı hem de yorumu karşılaştırın. Önemli işler için aritmetiği bağımsız olarak doğrulayın; ayrıntılı bir açıklama yine de bir hata içerebilir.

İSTEM 02
Bir ekip, her birinde sekiz katılımcı yeri bulunan dört oturum planlar. Bir oturum iptal edildi. Kaç yer kaldı? Bu farklı kişilerin sayısını belirliyor mu? Hesaplamayı gösterin ve nelerin çıkarılamayacağını açıklayın.

Test 3: davranışı icat etmeden bir fonksiyonu açıklayın

Aynı kısa fonksiyonu sağlayın ve normal giriş ile uç durumun sonucunu isteyin. Önce beklenen çıktıları hesaplayın, ardından açıklamaları karşılaştırın.

Bir modelin, kodun gerçekte yaptığıyla yapması gerekeni karıştırıp karıştırmadığını kontrol edin. Yararlı bir inceleme, gözlemlenen davranışı, şüphelenilen hatayı ve önerilen değişikliği ayrı tutar.

İSTEM 03
Bu işlevi açıklayın: [kod]. Girişler [normal durum] ve [kenar durum] için adımları ve beklenen çıktıyı izleyin. Gerçek davranışı olası hatalardan ayırın. Bunu gerçekleştirdiğinizi iddia etmeyin. Programlama dili veya çalışma zamanı hakkındaki varsayımlarınızı belirtin.

Rol için bir model seçin

İlk filtre olarak giriş uyumluluğunu kullanın, ardından aynı metin görevlerinde desteklenmeyen talepleri, kaçırılan kısıtlamaları ve düzeltme süresini karşılaştırın. Daha sonraki bir model güncellemesinin aynı örneklerle test edilebilmesi için orijinal yanıtları saklayın.

Bir sağlayıcının model karşılaştırması otomatik olarak GO AI ölçümü değildir. Araçlar, istemler ve hizmet ayarları deneyimi etkiler. Bu makale için kontrollü bir DeepSeek-versus-Kimi karşılaştırmasını çalıştırmadık; alıştırmalar yeniden kullanılabilir değerlendirme materyalleridir.

Sık sorulan sorular

Her iki modele de ekran görüntüsü vermeli miyim?

Adil bir metin-görev karşılaştırması için değil. Alıntı yapılan V4 Pro API listesi görmeyi desteklemiyor. Her ikisi için de doğrulanmış metni kullanın veya görüntünün anlaşılmasını ayrı ayrı değerlendirin.

Bu testleri hangi model kazandı?

Burada herhangi bir sonuç talep edilmemektedir. Bunlar test talimatlarıdır, kayıtlı model çıktıları değildir.

Kaynaklar ve kapsam