知识卡片:Artificial Analysis Optima:用自有任务构建自定义基准
英文标题:Launch Optima Build custom benchmarks from your own tasks to find the right model for your use case
英文关键词:Optima; Custom Benchmark; Artificial Analysis; Model Evaluation; Cost per Task
一句话结论
Optima 是 Artificial Analysis 推出的自定义基准构建工具,让用户将自己的任务/数据转化为可重复的基准,在最新模型上运行,并对质量、成本与耗时进行对比;标准化基准无法回答“哪个模型最适合我的具体场景”,Optima 试图填补这一空白。
事件概述
根据 Artificial Analysis 官网页面,Optima 允许用户“自带数据集、代理轨迹或自己的代理”,通过“构建 -> 运行 -> 评分”三步建立面向自身业务场景的基准测试,并比较前沿模型在性能、成本和耗时上的表现。页面展示了示例“Contract Review Benchmark”(合同审查基准),用于评估模型审查供应商合同、标记风险与提取条款的能力。发布/上线时间待核实。
方法/产品要点
- 构建:用户可描述任务、导入轨迹,或使用编码代理;构建代理会辅助草拟任务与评分细则(rubric)。
- 运行:可选择多种评估类型,包括问答(Q&A,有已知正确回答)、文档输入(针对上传文件回答问题)、代理式任务(使用工具完成交付物),交互式(Interaction)标记为“即将推出”。
- 评分:可以按自定义评分标准(rubric)由裁判模型逐条判定,也可以采用成对比较(pairwise)进行模型排名;问答类评分为确定性(对/错)。
- 自带代理:用户自己的代理可通过 HTTP 参与同一轮次运行。
- 定价:按 token 用量计费,创建和运行基准仅收取所用模型的原始 token 成本,不加价;Rubric 评分按“每个模型每个标准 0.125 美元”计费;成对比较评分按每场 0.375 美元计费。每个阶段会按预估冻结信用额度,实际用量多退少补(“只按实际使用量收费”)。
主要结果(示例)
页面给出的“Contract Review Benchmark”示例包含 24 个任务、4 个模型,结果如下(仅作为产品演示,不代表一般性结论):
| 模型 | 分数 | 成本/任务 | 时间/任务 |
|---|---|---|---|
| Claude Fable 5 | 60 | $0.18 | 74s |
| GPT-5.6 Sol | 59 | $0.11 | 52s |
| Kimi K3 | 57 | $0.04 | 61s |
| Gemini 3.6 Flash | 50 | $0.02 | 29s |
该示例表明:最强模型不一定成本最高/最低,Gemini 3.6 Flash 成本和耗时最低但分数也最低;用户需要依据自己的质量阈值和时间、成本约束做权衡。
为什么重要
标准化基准(如通用 LLM 榜单)衡量平均能力,却不能告诉用户“对你的合同审查、客服对话或特定数据查询,哪款模型更合适”。Optima 将评估权交还给用户,使模型选择从“看榜单”转向“跑自己的任务”。与 Artificial Analysis 已有的 AA-Briefcase(前沿知识工作基准)相比,AA-Briefcase 是平台方预设的高难度代理工作基准,而 Optima 是用户可自定义基准的基础设施;两者叠加显示 Artificial Analysis 正在从单一评测榜单扩展为“平台方预设评测 + 用户自定义评测”的评估体系。
局限与不确定性
- Optima 的正式发布日期、开放范围、可用模型列表、实际运行方式等细节:待核实。
- 页面中的评分定价与信用机制可能随版本调整:待核实。
- 示例中的模型名称与分数为页面演示数据,不能外推为真实性能排序;模型在用户自有任务上的表现需要用户自行运行确认。
- “交互式”任务类型尚未上线;主观评分(Subjective)的具体操作说明在材料中不完整,待核实。
可用于图书/PPT/简报的角度
- “从通用榜单到自定义基准”:模型评测如何从标准化测试走向面向具体业务的个性化评测。
- “AI 选型的三维坐标”:质量、成本、耗时——不止看分数。
- “企业如何用 Optima 类工具建立自己的模型评估闭环”:自带数据、任务模板、评分细则、持续追踪新模型。
- “评测即服务”:按 token 计费、自助构建、透明评分的方式对 AI 评估商业模式的影响。
原始材料
- 网页标题:Optima | Artificial Analysis
- 描述:Turn your own tasks into a repeatable benchmark, run frontier models on it, and compare quality against cost per task. Bring your own dataset, agent trajectories, or your own agent.
- URL:https://artificialanalysis.ai/optima