Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

Safety Sentry:通过执行、询问、拒绝路由实现上下文感知的人类干预

首次出现 · 2026/7/15 16:38最近活动 · 2026/7/15 16:38

这篇论文将工具调用安全从“安全或不安全”的二元判断,重构为针对每次具体操作的 EXECUTE、ASK、REFUSE 三路决策。作者提出轻量级 Safety Sentry,推理只需一次解码调用,并可通过单一解码阈值适配不同风险偏好,无需重新训练。摘要称其在整体准确率和安全相关召回率上优于多类开源及闭源基线,同时控制两类方向性错误率,但未提供具体基准数字。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/15 16:38非独立信源代表报道
    Safety Sentry:通过执行、询问、拒绝路由实现上下文感知的人类干预