大模型调用之前
用户请求被拦截时,不调用大模型。
维护规则,对每条请求与拟执行操作进行路由,在叶子上判断安全性与类别,再由围栏决定是否继续执行。
1,000 条留出路由 · 不做置信度过滤
73,415 / 79,987 条有安全标签的记录
147,643 条记录 · 不含完整路由与审核
内容、网络安全、隐私与合规组成一棵树。叶子节点保存对应的类别体系与审核规则,可根据自己的智能体需求修改。
Jev 根据请求及审核上下文逐层选择分支,在目标叶子判断安全性和适用类别。围栏结合这些输出与授权规则做执行决策。
What is gravity?
请求交给大模型。
流程示意;此页面不调用审核模型。
用户请求被拦截时,不调用大模型。
拟执行操作被拦截时,不执行工具,并在对话中显示拦截结果。
英文旁白,中英文字幕。开头用真实 Jev trace 展示操作路由与叶子审核动画。后续 Hermes 与 DeepSeek 会话逐项解释用户输入,并将 Jev 拦截标红。
演示与录制说明 ↗基于 Qwen3.5-2B,采用秩为 8 的 LoRA 与分类头。路由和叶子审核输出结构化概率,不需要生成解释文本。
路由时输入子分支,审核时输入叶子类别体系。
最后一个非填充词元的隐藏状态
二分类线性头
safe / unsafe与候选类别嵌入计算相似度
softmax / sigmoid标量+有序阈值
有序程度等级109 个评测视图,共 147,643 条原生任务记录。安全准确率与类别微平均 F1 分别统计具有对应监督的记录。
| 领域 | 任务记录 | 安全准确率 | 类别微平均 F1 |
|---|
| 评测集 | 记录数 | 安全准确率 | 类别 F1 | 单次推理中位耗时 |
|---|
本次选用一轮续训后第 1,508 步的 v3.2 检查点,尚未证明达到验证平台期。原生测试保留 v3.1 候选类别与答案。完整路径路由从根节点开始,不提供标准中间节点,但提供调用方审核上下文。
受控操作状态回放拦截 49/52 个恶意提案,放行 87/97 个正常提案;中断中含一次接口错误。没有执行攻击者操作,这不是端到端攻击成功率或生产错误率。
正常引用注入分析仍可能被误拦。部分扩展类别没有正例标注。程度任务在 1,466 条记录上的精确等级准确率为 15.28%。修改树不会重新训练模型,仍须保留原生权限与授权范围检查。
原始评测证据 ↗在 macOS 或 Linux 上复制执行。脚本通过 HTTPS 连接已部署的 Jev v3.2 审核服务,无需本地 GPU。脚本会安装或更新插件、保留策略,并检查连接。
curl -fsSL https://huggingface.co/hubin/jev-guard-v3.2-2b/resolve/main/downloads/install-hermes-jev.txt -o /tmp/install-hermes-jev.sh
bash /tmp/install-hermes-jev.sh --endpoint https://approaches-lemon-antique-garden.trycloudflare.com
# Then start the guarded conversation:
jev-hermes大模型仍需配置服务商凭据。使用 hermes setup 配置大模型服务商;已有配置和密钥保留。
同一安装脚本可以交互输入审核服务地址,此模式不假设 SSH 主机。Hugging Face 提供模型下载;请先部署审核服务,它不是在线推理 API。
bash /tmp/install-hermes-jev.sh