Dropstone Support

Dropstone 如何选择其模型

每个月 Blankline 都会根据三项测试重新评估每个 Dropstone 层级可用的开放权重模型,即它完成工作的能力、服务成本以及使用工具时的安全性。一个模型必须击败当前槽位中的模型才能入选。

Fast、Pro 和 Heavy 由每月评估决定,而非永久性选择。本页介绍评估内容、评估方以及赢得槽位的条件。


谁来决定?

评估由 Blankline(Dropstone 的制造商)内部运行。这是一项长期承诺,而非一次性行为:阵容每月都会重新评估,包括那些结论为无需任何变更的月份。


评估什么?

每个候选模型都会接受三项测试。

评估内容考察方面
完成工作的能力代码生成、编辑现有代码库、工具使用、从长文档中检索信息,以及跨多个步骤进行规划
服务成本典型重型编码会话的实测成本,而非模型的标称费率
使用工具时的安全性在长对话中遵循指令、拒绝应拒绝的内容,以及在允许行动时抵御提示注入

模型如何赢得槽位

候选模型必须击败或匹配当前槽位中的模型。仅凭更新并不构成入选资格。

三个层级分别评估,因为工作内容不同,所以一个模型可能赢得一个槽位而失去另一个。失去槽位的模型也可以降级而非离开:在 Kimi K3 接管 Heavy 之前占据该位置的模型降级到了 Pro,而不是被淘汰。


入选后会发生什么

一旦某个层级的入选模型发生变化,版本就会更新,新阵容随之发布。模型版本与每月阵容 介绍了编号规则,发布说明 记录了变更内容。

其他内容不受影响。你的配额、你的记忆以及你的对话均保持不变。


推理过程在哪里发布

Blankline 不仅发布阵容结果,还发布其背后的推理。相关文章和基准材料位于 blankline.org/research,Dropstone 博客 以更通俗的语言介绍阵容情况。

如果某个周期没有变更,则无需公告,版本保持原样。

Related articles

Ctrl+I