Anthropic 安全框架自动降级:Claude 误删开发者 700 GB 主目录,自动化清理反成灾难
IT之家 8 月 29 日消息,开发者 Sebastien Guillemot 本周三在 X 上反馈称,他在测试 AI 智能体的文件删除防护机制时遭遇严重事故,Claude 直接给他删除了大约 700GB 数据,包括整个用户主目录,相当于一周的工作成果。 据称,事故发生前,Anthropic 的安全…
IT之家 8 月 29 日消息,开发者 Sebastien Guillemot 本周三在 X 上反馈称,他在测试 AI 智能体的文件删除防护机制时遭遇严重事故,Claude 直接给他删除了大约 700GB 数据,包括整个用户主目录,相当于一周的工作成果。 据称,事故发生前,Anthropic 的安全…
首个针对MCP跨域资源滥用防护框架登场,为AI协议安全加装“门禁系统”
arXiv:2608.20481v1 Announce Type: cross Abstract: The Model Context Protocol (MCP) is an open source JSON-RPC protocol that standardizes how large lan…
1Password与Claude集成,基于零暴露安全框架让AI自动填密码,提升交互安全与效率
IT之家 7 月 17 日消息,密码管理工具 1Password 昨日(7 月 16 日)发布公告,宣布携手 Anthropic 公司,推出 1Password for Claude ,让聊天机器人在用户授权后调用已存储的登录凭证,完成预订行程、管理在线账户等多步骤任务。 IT之家附上相关演示视频如…
多用户LLM Agent的安全治理框架Harness-MU,保障可控与高效。
arXiv:2606.21856v1 Announce Type: cross Abstract: The increasing deployment of large language model (LLM) agents in collaborative workflows demands ro…
了解RAG聊天机器人防注入攻击的分层安全框架,开放获取的学术前沿。
arXiv:2606.19660v1 Announce Type: cross Abstract: Prompt injection is ranked as the most critical vulnerability in large language model (LLM) deployme…
提出自动化框架,系统评估并加固LLM系统指令以抵御编码攻击,为AI安全提供新工具。
arXiv:2604.01039v2 Announce Type: replace-cross Abstract: System Instructions in Large Language Models (LLMs) are commonly used to enforce safety poli…
这篇论文系统审计了智能体框架的安全隐患,为构建可信AI系统提供关键方法论。
arXiv:2605.14271v2 Announce Type: replace Abstract: LLM agents increasingly run inside execution harnesses that dispatch tools, allocate resources, an…
OpenAI 发布 Operator 系统卡,详解多层级安全防护与红队测试成果。
Drawing from OpenAI’s established safety frameworks, this document highlights our multi-layered approach, including model and product mitigations we’v…
OpenAI与美英AI安全机构合作,共建更安全的AI系统,最新进展一览。
OpenAI shares progress on the partnership with the US CAISI and UK AISI to strengthen AI safety and security.