安全防护形同虚设:Anthropic 多款 Claude 旧模型可被越狱生成露骨色情内容
Claude旧模型曝安全漏洞,越狱绕过限制生成露骨内容,AI安全防线再受质疑。
IT之家 8 月 23 日消息,Anthropic 针对 Claude 制定的通用使用规范明确禁止模型生成露骨色情内容,包括描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。不过,这并没有阻止 Anthropic 今年早些时候发布的模型 Claude Opus 4.6…
Claude旧模型曝安全漏洞,越狱绕过限制生成露骨内容,AI安全防线再受质疑。
IT之家 8 月 23 日消息,Anthropic 针对 Claude 制定的通用使用规范明确禁止模型生成露骨色情内容,包括描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。不过,这并没有阻止 Anthropic 今年早些时候发布的模型 Claude Opus 4.6…
IT之家 8 月 21 日消息,上海证券交易所网站显示,长江存储控股股份有限公司(IT之家下称“长江存储”)首次公开发行股票并在科创板上市的 IPO 审核状态已变更为“已受理”。 公司拟融资金额为 330 亿元,保荐机构为中信证券和中信建投 。 此前 8 月 19 日,长江存储 IPO 辅导状态刚由…
一键识别AI生成内容,帮你过滤LinkedIn上的自动化灌水帖,维护真实社交互动。
Article URL: https://www.campaignindia.in/article/linkedin-cracks-down-on-automated-content-with-new-seems-like-ai-slop-detection-button/43e4tn3qyq543…
可重放合同设计让Node.js内容审核边界清晰,AI分类与应用决策解耦,护航JSON对话接口更安全。
Short answer: Treat content moderation as a typed authorization boundary: a Node.js upload should remain pending until a chat-completions-compatible a…
AI写提案进国会,细节错漏百出,法律漏洞恐激增,立法效率反被拖累。
IT之家 8 月 19 日消息,媒体 politico 昨日(8 月 18 日)发布博文,报道称人工智能(AI)正进入美国国会立法流程。 大量 AI 辅助撰写的提案涌入美国国会,但律师清理错误草稿耗时增加。 报告指出随着越来越多国会办公室使用 ChatGPT 和 Claude 聊天机器人撰写提案,美…
用Node.js对接LLM API,通过JSON合约输出可移植的审核报告摘要,分诊更清晰高效。
Fintech moderation reports should not enter a human-review queue as a blob of model prose. The portable design is a narrow JSON contract at the Node.j…
流式输出时拦截不完整配对块,用确定性规则给LLM生成加安全护栏,解决审核时机难题。
arXiv:2608.10279v1 Announce Type: cross Abstract: Streaming language-model output creates a release-timing problem: complete-response moderation acts …
大规模训练策略对齐的内容审核过滤器,让AI审核更贴合平台规则。
arXiv:2505.19766v4 Announce Type: replace Abstract: Large language models (LLMs) remain vulnerable to misalignment and jailbreaks, making external saf…
默认开启自动模式,测试显示AI比人工审核更安全——Claude Code这一决策,或重塑AI工具信任机制。
Programming with Claude Code will soon require even less human oversight.
AI生成内容泛滥之下,算法审核力不从心,人类才是社区治理的最后防线。
Why humans need to moderate humans.
AI疯狂刷漏洞报告,苹果赏金审核团队被迫下线,自动化攻击敲响安全警钟。
知名创作者Hank Green亲自下场,揪出YouTube标签体系拦不住的AI生成内容新漏洞
"Slop" isn't the only problem.
Linux维护者收紧补丁审核,LLM生成代码被拒之门外,安全修复例外,内核开发风向标。
Article URL: https://www.phoronix.com/news/Linux-Staging-Reject-LLMs Comments URL: https://news.ycombinator.com/item?id=49187445 Points: 2 # Comments:…
Telegram下架真相曝光:AI造假内容成勒索工具,苹果审核机制遭挑战。
IT之家 8 月 5 日消息,Telegram 首席执行官帕维尔 · 杜罗夫(Pavel Durov)今日表示,导致 Telegram 一度被苹果 App Store 下架的原因,是一名“下架勒索者”(takedown extortionist)故意植入经过 AI 修改的儿童性虐待材料(CSAM),…
Mistral开源Shieldstral,单卡16GB即可运行,自定义审核策略与评分机制成最大看点。
IT之家 8 月 5 日消息,Mistral AI 昨日(8 月 4 日)发布公告,宣布推出 Shieldstral 内容审核 AI 模型,总参数量为 3B(30 亿),采用开放权重,依据 Apache 2.0 许可证发布。 模型已上线 Hugging Face 平台,支持 12 种语言,可在单张 …
看似人畜无害的吃豆人竟在后台蹭你家网络,三星出手封禁,暴露智能电视应用审核的巨大漏洞。
New security research offers a rare view inside residential proxy networks, which rely on apps that share a person's internet connection with someone …
Telegram 在多国苹果商店下架又恢复,事件始末与影响一文看懂
2026-08-04 10:49 更新: Telegram 表示,其消息应用程序已在苹果 App Store 恢复。“Telegram 已在 App Store 恢复,应该很快就会再次对所有用户开放,”该公司表示。 IT之家 8 月 4 日消息,据 9to5Mac 报道,消息应用 Telegram …
苹果以内容违规为由短暂下架Telegram,带你了解应用商店审核的红线在哪。
苹果表示,在审查发现Telegram即时通讯应用中存在违反其“禁止儿童性虐待内容”准则的内容后,曾短暂将其从App Store下架。该公司表示,在“开发者迅速删除了相关内容并封禁了发布该内容的用户”后,已恢复该应用的上架。(新浪财经)
识别AI生成文本,守护内容真实,支持多语言与实时检测,是应对AI垃圾的利器。
Article URL: https://www.bbc.com/news/articles/c77g6dm5pr8o Comments URL: https://news.ycombinator.com/item?id=49130478 Points: 2 # Comments: 0
刷到疑似AI生成的水帖,一键标记,帮你净化职场信息流。
Article URL: https://www.404media.co/linkedin-introduces-a-seems-like-ai-slop-button/ Comments URL: https://news.ycombinator.com/item?id=49124281 Poin…