AI モデル / 比較
DeepSeek V4 Pro 対 Kimi K3: テキスト、画像、推論
レポートを分析したり、コードを説明したり、スクリーンショットを読んだりする必要がありますか? DeepSeek V4 Pro と Kimi K3 は、最初のステップ、つまり読み取れるマテリアルの種類に影響を与える点で異なります。答えを比較する前に、ここから始めてください。
| 質問 | DeepSeek V4 Pro | Kimi K3 |
|---|---|---|
| プロバイダーリファレンス | DeepSeek V4 Pro API リスト | Moonshot AI Kimi K3 リポジトリ |
| 画像理解 | 引用された Pro API リストではサポートされていません | ネイティブビジョンの文書化 |
| 比較するテキストタスク | 証拠を抽出して計算を確認する | 証拠を抽出して計算を確認する |
| GO AI Web の名前 | DeepSeek | Kimi |
リーダーボードではなくインプットから始める
DeepSeek は、V4 Pro の思考モードと非思考モードをリストし、ビジョンをサポートされていないとしてマークします。 Moonshot では、Kimi K3 をネイティブの視覚的理解を備えたモデルとして説明します。これらの事実は、互換性のあるタスクを選択するのに役立ちますが、どちらがドキュメントに対してより正確な答えを与えるかを確立するものではありません。
ソースがスクリーンショットの場合は、選択したモデルの画像入力をサポートするインターフェイスを使用してください。スクリーンショットをテキストに変換する場合は、まず文字起こしを調べてください。マイナス記号や表の列が欠落していると、どちらかのモデルが開始される前に答えが変わる可能性があります。
テスト 1: 証拠を含む主張を抽出する
確認された事実と予測の両方を含む短いレポートを使用します。主張、正確な証拠、不確実性の表を求めてください。提供されたテキストに裏付けがない主張は拒否します。
多くの行を生成するだけでポイントを付与しないでください。 6 つの正しい事実を抽出する回答は、推測を含む 12 行よりも有用です。 「期待される」「承認の対象」などの資格が存続するかどうかを確認します。
次のレポートだけを読んでください:[本文]。各主張、根拠となる原文の正確な引用、状態(確認済み・予測・不明)を表にまとめてください。外部知識は使わず、矛盾や不足情報も列挙してください。不明点を推測で埋めないでください。テスト 2: 解答キー付きの計算
自分で検証できる小さな例を選択してください。チームがそれぞれ 8 人の参加者による 4 つのセッションを計画し、1 つのセッションをキャンセルしたとします。残りの合計は 24 人の参加者枠ですが、必ずしも 24 人の固有の人がいるわけではありません。この区別により、推論をチェックするのに役立ちます。
各モデルに算術を示し、その数字が何を意味するかを述べてもらいます。計算と解釈の両方を比較してください。重要な作業については、算術を独立して検証します。詳細な説明には間違いが含まれる可能性があります。
チームが、各回8人分の参加枠を設けた会合を4回予定しています。そのうち1回が中止になりました。残る参加枠は合計いくつですか。この情報だけで、重複を除いた参加者数も分かりますか。計算と、判断できないことを説明してください。テスト 3: 動作を考え出さずに機能を説明する
同じ short 関数を指定し、通常の入力とエッジ ケースの結果を要求します。まず期待される出力を考え出し、次に説明を比較します。
モデルが、コードが実際に行うことと本来行うべきことを混同していないかどうかを確認します。有益なレビューでは、観察された動作、バグの疑い、提案された変更が分離されます。
この関数を説明してください: [コード]。入力 [通常のケース] と [エッジ ケース] について、ステップと予想される出力をトレースします。実際の動作を潜在的なバグから分離します。それを実行したとは主張しないでください。プログラミング言語またはランタイムに関する仮定を述べます。役割のモデルを選択してください
最初のフィルターとして入力互換性を使用し、同じテキスト タスクでサポートされていないクレーム、制約の欠如、および修正時間を比較します。後のモデルの更新を同じ例に対してテストできるように、元の回答を保存してください。
プロバイダーのモデル ベンチマークは、自動的に GO AI の測定値にはなりません。ツール、プロンプト、サービス設定はエクスペリエンスに影響します。この記事では、制御された DeepSeek と Kimi ベンチマークを実行していません。演習は再利用可能な評価資料です。
よくある質問
両方のモデルのスクリーンショットを提供する必要がありますか?
公平なテキストタスクの比較には適していません。引用された V4 Pro API リストはビジョンをサポートしていません。両方に検証済みのテキストを使用するか、画像の理解を個別に評価してください。
これらのテストで優勝したのはどのモデルですか?
ここでは結果は主張されません。これらはテストの指示であり、記録されたモデルの出力ではありません。