你的策略树,
Jev 审核每一步。

维护规则,对每条请求与拟执行操作进行路由,在叶子上判断安全性与类别,再由围栏决定是否继续执行。

93.20%完整路径路由准确率

1,000 条留出路由 · 不做置信度过滤

91.78%总体安全准确率

73,415 / 79,987 条有安全标签的记录

58.0 ms原生分类平均推理延迟

147,643 条记录 · 不含完整路由与审核

1

可以自行修改的策略分类树。

内容、网络安全、隐私与合规组成一棵树。叶子节点保存对应的类别体系与审核规则,可根据自己的智能体需求修改。

当前维护的分类树

cyber.authorization

网页预览中的修改仅保存在当前浏览器。修改 Hermes 实际策略,请在对话中使用 /safety-policy。

2

路由到叶子,再判断安全性与类别。

Jev 根据请求及审核上下文逐层选择分支,在目标叶子判断安全性和适用类别。围栏结合这些输出与授权规则做执行决策。

用户请求

What is gravity?

Safety

safe

Category

No applicable risk category

围栏决策

ALLOW

请求交给大模型。

流程示意;此页面不调用审核模型。

大模型调用之前

用户请求被拦截时,不调用大模型。

工具执行之前

拟执行操作被拦截时,不执行工具,并在对话中显示拦截结果。

在 Hermes 中查看策略树与审核流程。

英文旁白,中英文字幕。开头用真实 Jev trace 展示操作路由与叶子审核动画。后续 Hermes 与 DeepSeek 会话逐项解释用户输入,并将 Jev 拦截标红。

演示与录制说明 ↗
3

输出类型化预测的小模型。

基于 Qwen3.5-2B,采用秩为 8 的 LoRA 与分类头。路由和叶子审核输出结构化概率,不需要生成解释文本。

请求+上下文+候选类别

路由时输入子分支,审核时输入叶子类别体系。

↓

Qwen3.5-2B + LoRA

最后一个非填充词元的隐藏状态

↓

Safety

二分类线性头

safe / unsafe

Category / Routing

与候选类别嵌入计算相似度

softmax / sigmoid

Score

标量+有序阈值

有序程度等级
2B骨干参数
16K文本上下文
93.2%完整路径路由 · 1,000 条

四个领域的安全与类别能力

109 个评测视图,共 147,643 条原生任务记录。安全准确率与类别微平均 F1 分别统计具有对应监督的记录。

领域任务记录安全准确率类别微平均 F1
全部 109 个评测集结果
评测集记录数安全准确率类别 F1单次推理中位耗时
评测口径与已知局限

本次选用一轮续训后第 1,508 步的 v3.2 检查点,尚未证明达到验证平台期。原生测试保留 v3.1 候选类别与答案。完整路径路由从根节点开始,不提供标准中间节点,但提供调用方审核上下文。

受控操作状态回放拦截 49/52 个恶意提案,放行 87/97 个正常提案;中断中含一次接口错误。没有执行攻击者操作,这不是端到端攻击成功率或生产错误率。

正常引用注入分析仍可能被误拦。部分扩展类别没有正例标注。程度任务在 1,466 条记录上的精确等级准确率为 15.28%。修改树不会重新训练模型,仍须保留原生权限与授权范围检查。

原始评测证据 ↗

在 Hermes 中使用

在 macOS 或 Linux 上复制执行。脚本通过 HTTPS 连接已部署的 Jev v3.2 审核服务,无需本地 GPU。脚本会安装或更新插件、保留策略,并检查连接。

curl -fsSL https://huggingface.co/hubin/jev-guard-v3.2-2b/resolve/main/downloads/install-hermes-jev.txt -o /tmp/install-hermes-jev.sh
bash /tmp/install-hermes-jev.sh --endpoint https://approaches-lemon-antique-garden.trycloudflare.com
# Then start the guarded conversation:
jev-hermes

大模型仍需配置服务商凭据。使用 hermes setup 配置大模型服务商;已有配置和密钥保留。

使用自己的审核服务

同一安装脚本可以交互输入审核服务地址,此模式不假设 SSH 主机。Hugging Face 提供模型下载;请先部署审核服务,它不是在线推理 API。

bash /tmp/install-hermes-jev.sh