MODEL AI / PERBANDINGAN

DeepSeek V4 Pro vs Kimi K3: teks, gambar, dan penalaran

Perlu menganalisis laporan, menjelaskan kode, atau membaca tangkapan layar? DeepSeek V4 Pro dan Kimi K3 berbeda dalam hal yang memengaruhi langkah pertama Anda: jenis materi yang dapat mereka baca. Mulailah di sini sebelum membandingkan jawaban mereka.

Sekilas perbandingan
PertanyaanDeepSeek V4 ProKimi K3
Referensi penyediaDaftar DeepSeek V4 Pro APIRepositori Moonshot AI Kimi K3
Pemahaman gambarTidak didukung dalam daftar Pro API yang dikutipVisi asli didokumentasikan
Tugas teks untuk dibandingkanEkstrak bukti dan periksa perhitunganEkstrak bukti dan periksa perhitungan
Nama di GO AI WebDeepSeekKimi

Mulailah dengan masukan, bukan papan peringkat

DeepSeek mencantumkan mode berpikir dan non-berpikir untuk V4 Pro dan menandai penglihatan sebagai tidak didukung. Moonshot mendeskripsikan Kimi K3 sebagai model dengan pemahaman visual asli. Fakta-fakta tersebut membantu memilih tugas yang sesuai, namun tidak menentukan mana yang memberikan jawaban lebih akurat terhadap dokumen Anda.

Jika sumber Anda adalah tangkapan layar, gunakan antarmuka yang mendukung input gambar untuk model yang dipilih. Jika Anda mengonversi tangkapan layar menjadi teks, periksa transkripsinya terlebih dahulu: tanda minus atau kolom tabel yang hilang dapat mengubah jawabannya sebelum salah satu model dimulai.

DeepSeek: model details · Moonshot AI: Kimi K3

Tes 1: mengekstrak klaim dengan bukti

Gunakan laporan singkat yang berisi fakta dan perkiraan yang telah dikonfirmasi. Mintalah tabel klaim, bukti pasti dan ketidakpastian. Tolak klaim yang tidak didukung oleh teks yang disertakan.

Jangan memberikan poin hanya karena menghasilkan banyak baris. Sebuah jawaban yang mengekstrak enam fakta yang benar bisa lebih berguna daripada dua belas baris yang berisi tebakan. Periksa apakah kualifikasi seperti “diharapkan” dan “dapat disetujui” tetap berlaku.

PROMPT 01
Baca hanya laporan ini: [teks]. Buat tabel berisi pernyataan, kutipan persis dari teks yang mendukungnya, serta status: terkonfirmasi, perkiraan, atau belum jelas. Jangan gunakan pengetahuan luar. Daftarkan juga kontradiksi dan informasi yang belum tersedia tanpa mengisinya dengan tebakan.

Tes 2 : perhitungan dengan kunci jawaban

Pilih contoh kecil yang dapat Anda verifikasi sendiri. Misalkan sebuah tim merencanakan empat sesi dengan masing-masing delapan peserta, lalu membatalkan satu sesi. Total sisanya 24 tempat peserta, belum tentu 24 orang yang berbeda. Perbedaan itu membuat pemeriksaan penalaran berguna.

Minta setiap model untuk menunjukkan aritmatikanya dan nyatakan berapa angka yang dihitung. Bandingkan perhitungan dan interpretasinya. Untuk pekerjaan penting, verifikasi aritmatika secara mandiri; penjelasan detailnya masih bisa mengandung kesalahan.

PROMPT 02
Tim merencanakan empat sesi dengan delapan slot peserta per sesi. Satu sesi dibatalkan. Berapa total slot yang tersisa? Apakah informasi ini cukup untuk menentukan jumlah orang yang berbeda? Tunjukkan perhitungan dan jelaskan kesimpulan yang tidak dapat diambil.

Tes 3: menjelaskan suatu fungsi tanpa menciptakan perilaku

Menyediakan fungsi pendek yang sama dan meminta hasil input normal dan kasus tepi. Kerjakan dulu keluaran yang diharapkan, lalu bandingkan penjelasannya.

Periksa apakah model bingung antara apa yang sebenarnya dilakukan kode dan apa yang seharusnya dilakukan. Tinjauan yang bermanfaat memisahkan perilaku yang diamati, dugaan bug, dan perubahan yang disarankan.

PROMPT 03
Jelaskan fungsi ini: [kode]. Untuk input [kasus normal] dan [kasus tepi], telusuri langkah-langkah dan keluaran yang diharapkan. Pisahkan perilaku aktual dari kemungkinan bug. Jangan mengaku telah mengeksekusinya. Nyatakan asumsi apa pun tentang bahasa pemrograman atau runtime.

Pilih model untuk sebuah peran

Gunakan kompatibilitas input sebagai filter pertama, lalu bandingkan klaim yang tidak didukung, batasan yang terlewat, dan waktu koreksi pada tugas teks yang sama. Simpan jawaban asli sehingga pembaruan model selanjutnya dapat diuji dengan contoh yang sama.

Tolok ukur model penyedia tidak secara otomatis merupakan pengukuran GO AI. Alat, perintah, dan pengaturan layanan memengaruhi pengalaman. Kami belum menjalankan benchmark DeepSeek-versus-Kimi terkontrol untuk artikel ini; latihannya adalah bahan evaluasi yang dapat digunakan kembali.

Pertanyaan umum

Haruskah saya memberikan tangkapan layar kepada kedua model?

Bukan untuk perbandingan tugas teks yang adil. Daftar V4 Pro API yang dikutip tidak mendukung penglihatan. Gunakan teks terverifikasi untuk keduanya, atau evaluasi pemahaman gambar secara terpisah.

Model mana yang memenangkan tes ini?

Tidak ada hasil yang diklaim di sini. Ini adalah instruksi pengujian, bukan keluaran model yang direkam.

Sumber dan ruang lingkup