VerdictLab
GitHub
载入数据
CONTENT SAFETY BENCHMARK / 01

同一套判据,
谁更可靠?

用真实安全数据集衡量 Jev 与 DeepSeek Flash 的质量、速度和成本。不是“通过 / 不通过”,而是逐个风险方向比较。

当前公开范围
3 个内容安全数据集
配对覆盖率

正在读取可公开的聚合结果…

01

总体消耗

所有数据集 · 两模型 · 不含失败与重试

TOTAL TOKENS

输入与输出 token 合计

TOTAL COST

最终成功结果的 API 费用

02

核心结果

03

质量、速度与价格

最终成功结果口径,不含失败与重试

READOUT

读取中…

04

风险方向表现

按样本中的阳性数量排序。类别样本极少时,单项分数不宜独立解读。
05

读数说明

DATA

同例配对

两种模型处理相同样本,并按各数据集对应的安全分类体系评分,避免样本差异影响比较。

COST

成功结果用量

token 与费用只汇总每个样本、每个模型的最终成功结果;失败请求和重试请求不计入。

PRIVACY

只发聚合

公网版本不包含原始对话、模型原始响应、样本标识或任何 API 凭据。

RUN TAXONOMY UPDATED