你该用哪个 AI 模型?
选你真正要做的事。你会得到一个推荐,以及更有用的东西——它背后的理由,这样当你更清楚时就可以不同意它。基于每天把 GPT-5、Gemini、Grok 4、Claude、DeepSeek 和 Kimi 并排使用。
1. 你要做什么?
2. 你最看重什么?(可选)
—
第二意见:
这是每天并排使用后的定性判断,时间点为 2026 年 8 月,不是跑分。完整推理见 速查表.
简短版本
- GPT-5——资深同事。结构清楚的写作、一次就能跑的代码、谨慎的推理。拿不准时,选它准没错。
- Gemini——研究员。把一摞长文档丢给它,让它理出头绪。
- Grok 4——永远在线的那个。时事、真正的双向语音、图像和视频生成,以及不用哄就有的幽默感。
- Claude——细心的编辑。六个里文笔最好的一个,也最愿意承认自己不确定。
- DeepSeek——高效的主力。不起眼但顶用,当你要把同一条提示跑上几百次时,它是性价比之选。
- Kimi——长上下文的实惠之选。一大堆输入照单全收,还不收长上下文的溢价。
所有模型都不擅长的事
你没核对过的引用、埋在行文里的算术,以及冷门的 API 细节。在这些情况下,六个模型都会给出自信而错误的东西。换模型解决不了这个问题——核对的习惯才行。
为什么按任务选优于从一而终
挑定一个模型从此不换,代价比偶尔选错更大。最强的工作流是把它们串起来:用活泼的那个起草,用严谨的那个重整结构,再让第三个来复核。这只有在切换成本很低时才成立——这正是多模型应用胜过四份订阅的理由。
逐项任务的完整推理,见 速查表,而被拿来比较最多的两个模型,有更长的分析见 Grok 4 对比 GPT-5.
这里的判断是定性的,截至 2026 年 8 月有效——模型能力变化很快,我们自己的使用经验一变,就会更新这里。 全部免费工具