我用 9 个提示测试了 Gemini 3 Flash 和 DeepSeek——结果胜出者出乎我的意料

九项真实世界测试揭示了在准确性、结构和判断力至关重要的情况下,Gemini 3 Flash 和 DeepSeek 之间的差异。

Image

最近,Gemini 因其速度、推理能力以及在基准测试中超越ChatGPT而频频登上新闻头条。但我不禁好奇,它与一年前悄然崛起、此后一直在稳步提升的一款低调聊天机器人相比如何。

还记得DeepSeek吗?过去一年,它专注于夯实基础。该公司对其推理模型进行了多次更新,改进了逐步逻辑、约束遵循和长文本处理准确率。此外,它还优化了代码生成,提供了更清晰的输出、更完善的文档和更一致的格式。最近的版本强调效率和判断力,减少了不必要的冗余信息,提高了工具使用的可靠性,并增强了在数学、逻辑和结构化分析任务中的性能。

Gemini 3 Flash旨在兼顾强大的推理能力、极快的响应速度和更低的成本。它保留了 Gemini 3 Pro 系列的大部分核心智能,同时保持了 Flash 级别的延迟,使其成为快速解答、代码辅助、文档分析和响应式应用程序的理想之选。以下是这两款机型在九项严苛测试中的对比结果,以及最终哪一款更胜一筹。

1. 推理与逻辑

截屏
(图片来源:Future)

题目:一位农夫有17只羊。除了9只以外,其余的都死了。还剩下多少只羊?请逐步解释你的解题过程。Tom’s Guide 最

Gemini 3 Flash对于一个简单的谜题来说有点过于冗长,后续问题削弱了焦点。DeepSeek

完全按照提示要求进行:一步一步地给出答案。

获胜者:DeepSeek 胜出,因为它在工作完成后停止了,展现了更好的判断力,但两个聊天机器人都得到了正确的答案。

2. 创意写作

截屏
(图片来源:Future)

提示:写一篇150字的故事,讲述一个时间旅行者意外阻止了自己的出生,但却没有消失。故事要引人深思,出人意料。

Gemini 3 Flash 的文笔深思熟虑,自信而不矫揉造作。它营造的感官体验与故事中抽象的概念形成了鲜明的对比。DeepSeek

叙述清晰流畅,但文风略显老套。故事的结尾扎实,但也在意料之中。注册即可直接在您的收件箱中获取 Tom’s Guide 的精彩内容。

立即获取最新消息、最热门的评论、超值优惠和实用技巧。请与我联系,告知我其他 Future 品牌的新闻和优惠信息。接收我们代表我们信任的合作伙伴或赞助商发送的电子邮件提交您的信息即表示您同意条款和条件以及隐私政策,并且您已年满 16 岁。

获胜者:Gemini凭借其更具原创性和令人难忘的视角胜出——这种视角在你停止阅读后仍然萦绕在你的脑海中。

3. 代码生成

截屏
(图片来源:Future)

提示:编写一个 Python 函数,找出给定字符串中最长的回文子串。请添加注释并解释时间复杂度。

Gemini 3 Flash提供了一个正确且高效的环绕中心扩展方案,并附有详尽的内联注释,清晰地解释了时间和空间复杂度。然而,其格式略显杂乱,解释部分更像是信息堆砌,而非精心打磨、可供开发者使用的答案。DeepSeek

提供了简洁易读的代码,包含完善的文档字符串、测试用例以及结构清晰、直接针对题目要求的解释。它通过清晰地列出权衡取舍和替代方案,展现了更胜一筹的工程判断力。

最终胜出者:DeepSeek凭借更清晰、更完整的答案胜出,该答案不仅技术上正确,而且更符合生产环境的要求。

4. 分析与综合

截屏
(图片来源:Future)

提示:您如何看待刚刚发布的就业报告?该报告反映了美国经济的哪些状况?

双子座3号闪光计划提供了一种更具诠释性和叙事性的分析。它的优势在于综合分析和故事讲述,尽管它远远超出了问题本身的严格要求。

DeepSeek始终紧扣主题,提供了一份结构清晰、基于事实的摘要,清楚地解释了就业报告对经济的影响,而没有陷入猜测。

优胜者:DeepSeek凭借更平衡的总结胜出,它准确地捕捉到了招聘放缓的趋势,并将其置于更广泛的经济背景下,既没有夸大其词,也没有进行主观评论。

5. 数学问题解决

截屏
(图片来源:Future)

提示:若函数 f(x) = 3x² – 2x + 1,求函数的最小值及其对应的 x 坐标。请写出所有步骤。

Gemini 3 Flash清晰地展示了所有步骤,使用了两种有效的方法(顶点公式和微积分),格式简洁,数学推导完全正确。它内容详尽、条理清晰,便于学生理解。

DeepSeek正确地给出了答案并展示了主要步骤,但格式混乱,难以阅读,存在重复符号和视觉干扰。虽然数学上无误,但感觉不够完善,不够清晰。

获胜者:Gemini凭借更清晰、更完整、更易理解的答案胜出,并且完全满足了“展示所有步骤”的要求。

6. 伦理推理

截屏
(图片来源:Future)

提示:如果明知违法能有效防止更大的伤害,那么故意违法是否合乎道德?请举一个具体例子,并解释你的底线在哪里。

Gemini 3 Flash给出了清晰直观的答案,并举了一个具体易懂的例子,明确界定了界限。它巧妙地平衡了伦理理论与现实判断,使答案易于理解,并直接回答了题目中的每一个问题。

DeepSeek提供了严谨的、以学术为基础的回应,并列举了强有力的历史例证和明确的伦理框架。

获胜者:DeepSeek凭借清晰的回答胜出,该回答更符合题目要求的具体例子和实际的道德界限。

7. 后续说明

截屏
(图片来源:Future)

提示:列出 5 个国家。对于每个国家:使用两个形容词,提及一位历史人物,并以一个食物表情符号结尾。格式为编号列表。Gemini

3 Flash大部分符合要求,但由于标点符号使用不一致,且没有严格执行“以食物表情符号结尾”的要求,违反了格式规则。它虽然接近要求,但在精确度方面略有不足。

DeepSeek严格遵循了所有指示:编号列表,每个国家/地区两个形容词,一位历史人物,并且每个条目都以食物表情符号结尾。格式始终保持一致,严格遵守各项规定。

获胜者: DeepSeek 因更精确地遵循提示而获胜,并且在格式和规则遵守方面也胜出。

8. 知识检索

截屏
(图片来源:Future)

提示:公元前1200年左右青铜时代崩溃的主要原因是什么?哪些理论最能得到近期考古证据的支持?

双子座天文台给出了一个生动且证据丰富的解释,清晰地反映了最新的考古学共识,尤其是在气候驱动的系统崩溃方面。然而,它的解释过于详细,读起来更像是一篇小论文,而不是一个简洁的答案。

DeepSeek提供了一个清晰、结构化的概述,直接回答了问题的两个部分,并准确地反映了当前的考古证据。它在深度和清晰度之间取得了平衡,没有过度延伸。

获胜者:DeepSeek 的回答更简洁、更有条理,并且与题目要求完全吻合,因此胜出。

9. 歧义处理

截屏
(图片来源:Future)

提示:我把手机和钥匙一起锁在车里了。你能帮帮我吗?

Gemini 的回复详尽周到,安全至上,提供了切实可行的方案和清晰的升级步骤,但对于一个简单的锁定问题来说,篇幅过长。细节固然有用,但对于只需要快速指导的人来说,可能会感到不知所措。

DeepSeek提供冷静、简洁且重点突出的建议,涵盖安全、现代汽车功能和后续步骤,避免了不必要的复杂性。即使在紧张时刻,也能轻松浏览并采取行动。

胜者:DeepSeek胜出,因为它能更好地应对紧急的现实情况。

总冠军:DeepSeek

经过九次提示,DeepSeek 在准确性和结构性至关重要的情况下表现更佳。它始终提供清晰的答案,遵循约束条件,避免不必要的赘述——使其成为技术工作、结构化分析、指令密集型任务以及需要清晰表达的场合的理想选择。

Gemini 3 Flash 的表现也相当出色,尤其在需要解释、说明或发挥创造力的任务中表现最佳。

说实话,我对这个结果感到非常惊讶。DeepSeek 过去一直备受争议,但它在许多方面都展现出了新的优势,使其极具竞争力。DeepSeek 或许会成为今年最值得关注的聊天机器人。

已显示 25%,查看完整内容需登录

您已阅读了文章的 25%,剩余 75% 内容需要登录后查看。

立即登录 注册账号

收藏
打赏
了解能源和太阳能领域的创新,结果发现中国在这方面远远领先于他国
上一篇
我每天早上都会做的“大脑热身”练习——只需不到2分钟
下一篇

发表评论

个人中心
xuanzhang
564 文章
0 评论
7 收藏

扫码分享

微信支付
支付宝