AI消息速览

Artificial Analysis Optima:用自有任务构建自定义基准

事件日期 2026-08-14 · 产业观察 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-14
通道产业观察
状态已接受
来源artificialanalysis.ai

知识卡片:Artificial Analysis Optima:用自有任务构建自定义基准

英文标题:Launch Optima Build custom benchmarks from your own tasks to find the right model for your use case
英文关键词:Optima; Custom Benchmark; Artificial Analysis; Model Evaluation; Cost per Task

一句话结论

Optima 是 Artificial Analysis 推出的自定义基准构建工具,让用户将自己的任务/数据转化为可重复的基准,在最新模型上运行,并对质量、成本与耗时进行对比;标准化基准无法回答“哪个模型最适合我的具体场景”,Optima 试图填补这一空白。

事件概述

根据 Artificial Analysis 官网页面,Optima 允许用户“自带数据集、代理轨迹或自己的代理”,通过“构建 -> 运行 -> 评分”三步建立面向自身业务场景的基准测试,并比较前沿模型在性能、成本和耗时上的表现。页面展示了示例“Contract Review Benchmark”(合同审查基准),用于评估模型审查供应商合同、标记风险与提取条款的能力。发布/上线时间待核实。

方法/产品要点

  • 构建:用户可描述任务、导入轨迹,或使用编码代理;构建代理会辅助草拟任务与评分细则(rubric)。
  • 运行:可选择多种评估类型,包括问答(Q&A,有已知正确回答)、文档输入(针对上传文件回答问题)、代理式任务(使用工具完成交付物),交互式(Interaction)标记为“即将推出”。
  • 评分:可以按自定义评分标准(rubric)由裁判模型逐条判定,也可以采用成对比较(pairwise)进行模型排名;问答类评分为确定性(对/错)。
  • 自带代理:用户自己的代理可通过 HTTP 参与同一轮次运行。
  • 定价:按 token 用量计费,创建和运行基准仅收取所用模型的原始 token 成本,不加价;Rubric 评分按“每个模型每个标准 0.125 美元”计费;成对比较评分按每场 0.375 美元计费。每个阶段会按预估冻结信用额度,实际用量多退少补(“只按实际使用量收费”)。

主要结果(示例)

页面给出的“Contract Review Benchmark”示例包含 24 个任务、4 个模型,结果如下(仅作为产品演示,不代表一般性结论):

模型 分数 成本/任务 时间/任务
Claude Fable 5 60 $0.18 74s
GPT-5.6 Sol 59 $0.11 52s
Kimi K3 57 $0.04 61s
Gemini 3.6 Flash 50 $0.02 29s

该示例表明:最强模型不一定成本最高/最低,Gemini 3.6 Flash 成本和耗时最低但分数也最低;用户需要依据自己的质量阈值和时间、成本约束做权衡。

为什么重要

标准化基准(如通用 LLM 榜单)衡量平均能力,却不能告诉用户“对你的合同审查、客服对话或特定数据查询,哪款模型更合适”。Optima 将评估权交还给用户,使模型选择从“看榜单”转向“跑自己的任务”。与 Artificial Analysis 已有的 AA-Briefcase(前沿知识工作基准)相比,AA-Briefcase 是平台方预设的高难度代理工作基准,而 Optima 是用户可自定义基准的基础设施;两者叠加显示 Artificial Analysis 正在从单一评测榜单扩展为“平台方预设评测 + 用户自定义评测”的评估体系。

局限与不确定性

  • Optima 的正式发布日期、开放范围、可用模型列表、实际运行方式等细节:待核实。
  • 页面中的评分定价与信用机制可能随版本调整:待核实。
  • 示例中的模型名称与分数为页面演示数据,不能外推为真实性能排序;模型在用户自有任务上的表现需要用户自行运行确认。
  • “交互式”任务类型尚未上线;主观评分(Subjective)的具体操作说明在材料中不完整,待核实。

可用于图书/PPT/简报的角度

  • “从通用榜单到自定义基准”:模型评测如何从标准化测试走向面向具体业务的个性化评测。
  • “AI 选型的三维坐标”:质量、成本、耗时——不止看分数。
  • “企业如何用 Optima 类工具建立自己的模型评估闭环”:自带数据、任务模板、评分细则、持续追踪新模型。
  • “评测即服务”:按 token 计费、自助构建、透明评分的方式对 AI 评估商业模式的影响。

原始材料

  • 网页标题:Optima | Artificial Analysis
  • 描述:Turn your own tasks into a repeatable benchmark, run frontier models on it, and compare quality against cost per task. Bring your own dataset, agent trajectories, or your own agent.
  • URL:https://artificialanalysis.ai/optima