3327318066 QQ
新闻资讯
新闻资讯
NEWS
联系我们
联系人:菲菲
电话:3327318066 QQ
手机:3327318066 QQ
邮箱:3327318066 QQ
地址:长沙
关注我们

关注我们

当前位置:首页 >> 新闻资讯

新闻资讯

上海品茶工作室,AI榜单格局再度变动:谷歌科学推理反超,编程领域仍是Claude占优
发布时间:2026-07-05

上海品茶工作室,AI榜单格局再度变动:谷歌科学推理反超,编程领域仍是Claude占优

近期海外多家权威AI评测平台更新6月最新大模型横向排行榜,各大模型细分领域强弱格局再次出现明显变化。综合多项基准测试结果,谷歌Gemini 3.1 Pro在数理科学推理项目实现反超,而代码编程领域依旧由Anthropic的Claude系列牢牢占据领先位置。

本次评测参考SWE‑bench代码测试集、GPQA理科推理、ARC‑AGI逻辑推理等多个权威榜单数据。整体综合排名上Anthropic的Claude Opus4.8综合总分依旧排在首位,通用对话、长文本理解能力依旧稳定。但拆开细分赛道,各模型优劣势分化越来越明显,已经不存在全能型冠军。

在物理、化学、高等数学等硬核科学推理测试中,谷歌新一代Gemini 3.1 Pro表现大幅提升,复杂多步骤数理推导、理科逻辑推演正确率反超Claude以及GPT‑5.5。谷歌深度思考模式优化了长链条分步推理逻辑,面对多步骤复杂理科题目,不容易出现逻辑跳步、中途推理跑偏的问题,科学推理单项得分目前排名全球第一。

反观代码编程赛道,局势几乎没有变化。在真实软件工程测试SWE‑bench榜单里,Anthropic Claude系列依旧稳居榜首。不管是后端大型项目开发、复杂程序排错调试,还是完整工程重构,Claude能够更好理解完整项目代码上下文,一次性排查多处程序漏洞。谷歌、OpenAI虽然代码能力持续提升,但面对大型复杂工程项目,整体稳定性依旧不及Anthropic,编程领域优势短期内很难被撼动。

OpenAI的GPT‑5.5则处于中间位置,各项能力均衡,没有明显短板,但也没有单项拔尖优势,综合性能稳定,偏日常通用任务和智能体自主执行任务。

业内从业者分析,现在各大厂商技术路线分化越来越清晰。谷歌主攻数理逻辑、多模态音视频推理;Anthropic深耕代码开发、超长上下文;OpenAI侧重通用智能体自主任务。各家模型侧重点不同,赛道各有强弱。未来很难出现一款大模型包揽所有项目第一,大模型竞争正式进入细分赛道比拼的时代。对于普通使用者而言,不同场景适合选用的AI工具也各不相同,做理科运算优先谷歌模型,写代码开发优先Claude,日常综合办公可以选择GPT系列。