视频号
    标题 摘要 内容
    详情

    近日,独立 AI 评测机构 Vals AI 更新 Vals Index 榜单,谷歌新一代前沿大模型 Gemini 4 Argon 以68.90%的综合得分登顶,在参评的 41 款模型中位列第一,超越 Claude Sonnet 5.5、Claude Opus 5.5、GPT-6 Astra 等主流前沿模型,成为当前在企业专业工作场景综合能力最强的 AI 模型。


    Vals Index 是一套面向真实商业任务的 AI 综合评测体系,区别于传统通用大模型试题,它选取金融、代码、法律、税务四大专业领域任务,按照各行业对美国 GDP 贡献权重加权计算,用于衡量智能体模型落地后的实际经济价值,聚合了多项私有与公开子基准测试,兼顾模型能力、推理成本与落地效率。


    本次评测数据显示,Gemini 4 Argon 领先第二名 Claude Sonnet 5.5(67.04%)近 2 个百分点;从单任务成本看,Gemini 4 Argon 单轮测试成本 15.68 美元,低于 Claude 系列多款旗舰模型,实现性能与成本的双重优势。


    分项能力亮点:

    1. 金融智能体 Vals Finance Agent v2:得分 65.40%,排名第一,擅长多步骤金融调研与分析;

    2. IOI 任务:与 GPT-6 Astra 并列满分 100%;

    3. AutomationBench 自动化业务基准:51.3%,位居榜首,擅长端到端企业业务流程自主执行;

    4. 长周期软件工程 DeepSWE v1.1:77.9%,刷新该基准纪录;

    5. 漏洞修复 CWE-bench v1:68%,与 GPT-6 Astra 并列第一;

    6. 法律方向 Harvey’s Legal Agent Benchmark 也取得显著领先优势Vals AI。


    在代码迁移、Vibe Code Bench 等部分代码子项中,Gemini 4 Argon 略逊于 Claude Sonnet 5.5,并非全赛道全胜,体现前沿模型各有能力侧重。该模型支持最高 100 万 token 上下文,主打长时序复杂任务、企业知识工作、自主代码工程与网络安全防御场景,面向企业级智能体应用打造,可完成多步骤、长链条的复杂业务自主执行,契合当前行业智能体落地需求。