真香:《我的世界》创始人佩尔松承认自己早期拒绝 AI 编程“可能错了”
IT之家 8 月 28 日消息,据《商业内幕》今天(28 日)报道,《我的世界》创作者、亿万富翁马库斯 · 佩尔松对 AI 的态度发生了彻底转变。 以“Notch”之名广为人知的佩尔松,过去曾坚决反对用 AI 编程。今年 1 月,他甚至写道:“(AI 编程)仍然是个糟糕透顶的主意,任何鼓吹这种做法的…
IT之家 8 月 28 日消息,据《商业内幕》今天(28 日)报道,《我的世界》创作者、亿万富翁马库斯 · 佩尔松对 AI 的态度发生了彻底转变。 以“Notch”之名广为人知的佩尔松,过去曾坚决反对用 AI 编程。今年 1 月,他甚至写道:“(AI 编程)仍然是个糟糕透顶的主意,任何鼓吹这种做法的…
IT之家 8 月 20 日消息,在今日的享界 G9 及鸿蒙智行新品发布会上,北汽集团党委书记、董事长张建勇发表演讲。 张建勇表示,关于享界 G9 这台车,今天他想和大家分享的就是三个字 —— 不一样, 真正做到了豪华与硬派的融合,拒绝表面化的方盒子外壳 。 张建勇称,大家都知道这两年的 SUV 市场…
一个天才AI学者的抉择:拒绝苹果留美高薪,回国缔造月之暗面,如今Kimi K3登顶全球,估值350亿美元。
IT之家 8 月 4 日消息,Kimi K3 模型发布后蝉联前端开发榜全球第一,月之暗面这家中国 AI 创企成为了人们关注的焦点。 月之暗面创始人杨植麟的卡内基梅隆大学博士生导师 Russ Salakhutdinov 今年 7 月发文,透露了关于杨植麟回国创业的一些细节。 Russ Salakhut…
OpenAI悄然为ChatGPT添加新规:拒绝模仿在世作家文笔,防止AI生成内容侵权
IT之家 7 月 28 日消息,据科技媒体 Android Authority 今天报道,OpenAI 最近悄悄更新 ChatGPT。当用户要求按某位在世作家文笔仿写作品时,AI 会直接拒绝。 实测显示,当用户要求用斯蒂芬 · 金(IT之家注:Stephen King)的写作风格创作开场时,Chat…
IT之家 7 月 23 日消息,瑞士铁路巨头 Stadler Rail(施泰德铁路)发布公告,透露公司近期遭到黑客组织 Everest 攻击,公司拒绝向黑客团队支付赎金,并计划提起法律诉讼。 公开信息显示,Stadler Rail 是全球知名铁路车辆跨国制造商,业务涵盖高速列车、城际列车、区域铁路车…
IT之家 7 月 21 日消息,据外媒 carscoops 报道,丰田美国官网 Toyota.com 近期被指网站跟踪弹窗“拒绝”按钮实为虚设,用户在点击按钮明确拒绝追踪后,网站仍持续收集追踪用户浏览数据。 据悉,丰田美国官网部署了“浏览器指纹识别(Fingerprinting)”技术。该技术并不依…
ECCV 2026新作:输出感知安全护栏,精准解决多模态大模型“宁可错杀一千”的过度拒绝问题。
arXiv:2607.09697v1 Announce Type: new Abstract: Existing safety mechanisms for multimodal large language models (MLLMs) face a fundamental trade-off b…
三星健康新增条款,用户拒绝AI训练授权将无法备份数据,健康数据与功能捆绑引发隐私争议。
IT之家 7 月 14 日消息,科技媒体 Neowin 昨日(7 月 13 日)发布博文,报道称三星健康(Samsung Health)新增选项, 用户若不同意其健康数据用于训练 AI,可能无法备份数据且被威胁删除数据。 在三星健康应用设置中,三星新增“同意将健康数据用于人工智能训练和建模”的选项,…
阿克苏诺贝尔7月13日宣布拒绝立邦涂料对其装饰涂料业务的收购提议,继续建议推进与艾仕得涂料的合并计划。这份新的75亿欧元(86亿美元)收购方案,是立邦在多次尝试与阿克苏诺贝尔达成交易之后提出的。阿克苏诺贝尔表示,最新提议“严重低估”了其涂料业务部门的价值。阿克苏诺贝尔称,其管理层和监事会“继续一致建…
IT之家 7 月 11 日消息,据 IGN 今天报道,《奥德赛》导演克里斯托弗 · 诺兰近日接受采访, 谈到年轻观众对所谓“AI 垃圾”(IT之家注:AI Slop)内容的看法 。 诺兰表示:“我从不相信‘年轻观众的注意力被毁掉,无法欣赏一部长达三小时的希腊史诗电影’这种说法。这些电影充满神秘感也引…
从电路层面微调权重,让大模型学会选择性拒绝——AI安全的新思路。
arXiv:2602.04521v2 Announce Type: replace Abstract: Modern deployments require LLMs to enforce safety policies at scale, yet many controls rely on inf…
针对LLM代理的伪装MCP攻击,提出改进偏好对齐的拒绝训练方法,附RAG免训练对齐方案。
Article URL: https://github.com/johnhalloran321/mcp_safety_training Comments URL: https://news.ycombinator.com/item?id=48834106 Points: 1 # Comments: …
最新研究发现:LLM能分离编码“有害性”与“拒绝行为”,揭示安全机制新维度。
arXiv:2507.11878v5 Announce Type: replace Abstract: LLMs are trained to refuse harmful instructions, but do they truly understand harmfulness beyond j…
安全对齐虽关键,但一刀切的拒绝机制在网络安全等高风险领域适得其反,这篇论文揭示了系统性缺陷。
arXiv:2607.02714v1 Announce Type: cross Abstract: There is no doubt that safety alignment is an essential step in LLM training. However, conceptually …
用因果审计拆解神经元选择器,探究模型拒绝行为是否忠实可靠,值得深读。
arXiv:2607.05355v1 Announce Type: cross Abstract: Attribution scores increasingly identify which neuron rows of a language model matter for applicatio…
开源项目,用默认拒绝、人工审批和加密审计追踪锁定AI代理危险行为,杜绝自授权漏洞。
Article URL: https://github.com/makerchecker/MakerChecker Comments URL: https://news.ycombinator.com/item?id=48804182 Points: 16 # Comments: 8
用RFM-AGOP快速定位多维度拒绝子空间,为AI安全可解释性提供高效新方法。
arXiv:2607.02396v1 Announce Type: new Abstract: Steering and monitoring activations in Large Language Models (LLMs) are increasingly used for both saf…
揭秘大模型“拒绝”背后的护栏激活机制:如何通过行为监控精准判断模型何时触发安全防线?
arXiv:2607.02121v1 Announce Type: cross Abstract: As Large Language Models (LLMs) and agentic systems become integrated into real-world applications, …
聚焦大模型安全对齐,将有害性与拒绝方向耦合,为抵御越狱攻击提供更鲁棒的新思路。
arXiv:2607.00572v1 Announce Type: new Abstract: Understanding how aligned LLMs internally represent safety is critical for diagnosing alignment vulner…
多模态大模型学会“拒绝执行”了,ECCV 2026新研究解析动作拒绝机制,AI安全再进一步。
arXiv:2606.31187v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) have rapidly advanced video understanding, achieving strong z…