AI 模型 / 对比
Gemini 3.7 Flash 与 Claude Sonnet 5:哪个适合您的工作?
同一工作日的两种模式:起草、理解文档和审查代码。以下是重要的差异、三个即用型比较提示以及在 GO AI 中尝试它们的路径。
| 问题 | Gemini 3.7 Flash | Claude Sonnet 5 |
|---|---|---|
| 官方强调 | 多模态推理;文本输出 | 编码、工具使用和多步骤工作 |
| 命名为GO AI Web | Gemini | Claude |
| 提供商代币容量 | 1,048,576 输入; 65,536 输出 | 1M 上下文; 128K 输出 |
| 名称并不能保证什么 | 图像生成或GO AI中的每个Google工具 | GO AI 中已连接的终端或自主编码 |
实际上有什么不同?
Google 记录 Gemini 3.7 Flash 的文本、图像、视频、音频和 PDF 输入,并带有文本输出。它不是图像生成模型。 Anthropic 围绕编码、推理和工具辅助工作介绍了 Sonnet 5。这些是提供商的能力和定位,而不是我们自己的面对面测试的结果。
聊天界面仅公开模型的部分功能。 API 功能列表并不意味着相同的文件类型、工具或上下文允许在 GO AI 中可用。对于此比较,从网络聊天支持的普通文本任务开始。
Google: Gemini 3.7 Flash · Anthropic: Claude Sonnet 5 · Anthropic: Sonnet 5.5, 28 September 2026 · Anthropic: Sonnet 5 specifications
测试 1:具有固定事实的客户端消息
使用包含日期、名称、金额和一个不确定性的简短草稿。要求重写,然后在判断风格之前检查这四个细节。一个完美的答案将估计变成了承诺,但未能通过测试。
仅在两个模型都回答了原始简报后才尝试第二种音调。否则你就是在比较不同的指令。将原始草稿放在答案旁边,以便您可以验证每项更改。
以[语气]语气为[观众]重写此消息。保持所有名称、金额和日期不变。保持不确定性;不要添加承诺。使用不超过 120 个单词。然后列出所有需要澄清的事实。草稿:[文本]。测试2:可检查的总结
为每个模型提供相同的会议记录。计算发明的决策、遗漏的行动和错误分配的负责人。这将有吸引力的摘要与可靠的摘要区分开来。
在注释中包含未解决的提案。有用的答案可以将其与已批准的决策分开。不要假设任一模型已读取链接文档,除非您实际提供了其内容。
只使用这些会议记录:[记录]。分成三个部分:已作出的决定、带负责人和截止日期的行动项、尚未解决的问题。为每项决定引用原文依据。未写明负责人或日期时,标注“未说明”。不要把建议当成已经作出的决定。测试 3:小型代码审查
提供一个简短的函数、预期的行为和一个失败的示例。比较答案是否确定了可重现的问题、提出了有针对性的修复方案并解释了有意义的测试。
生成的测试不是测试结果。在接受修复之前,请在您自己的开发环境中运行建议的检查。这两个模型都不应因声称在普通聊天中执行了代码而获得荣誉。
查看此代码:[代码]。预期行为:[要求]。失败示例:[输入和观察到的输出]。确定可能的原因,提出最小的修复方案,并在修复之前进行失败的测试。说明您尚未执行的内容。对比后如何选择
对于每项任务,记录事实错误、错过的说明以及纠正答案所花费的时间。一个简单的通过/失败检查表比发明的整体智力分数更有用。
在将某个模型设为默认模型之前重复一项重要任务。如果 Gemini 可以更好地处理您的摘要,并且 Claude 需要对您的代码进行更少的修正,请保留这两个角色。我们推荐的是这种测试方法;我们尚未针对本文运行受控基准测试。
常见问题
Gemini 3.7 Flash 生成图片吗?
否:Google 记录此模型的文本输出。图像创建使用单独的图像模型。
Claude 总是更擅长编码吗?
本文并未证实这一点。测试对您重要的特定代码和验收检查。