1
Safety from Honesty in a Disinterested AI Predictor
Yoshua Bengio领衔提出以诚实性约束打造“无兴趣”AI预测器,为AI安全开辟一条全新理论路径。
arXiv:2606.29657v1 Announce Type: cross Abstract: As AI systems become more capable, training procedures that optimize for downstream outcomes risk in…