日本公布 AI 草案,敦促开发者披露训练数据
日本拟出新规,要求生成式AI开发者披露训练数据,平衡创新与版权,值得关注。
IT之家 8 月 19 日消息,日本内阁府昨日(8 月 18 日)公布针对生成式 AI 开发者的指导方针草案,要求开发者披露训练数据及数据收集方式。 IT之家援引博文介绍,该草案规划建立 AI 框架,平衡快速发展的 AI 技术创新和版权保护,一方面规范生成式 AI 开发者合理使用知识产权,另一方面也…
日本拟出新规,要求生成式AI开发者披露训练数据,平衡创新与版权,值得关注。
IT之家 8 月 19 日消息,日本内阁府昨日(8 月 18 日)公布针对生成式 AI 开发者的指导方针草案,要求开发者披露训练数据及数据收集方式。 IT之家援引博文介绍,该草案规划建立 AI 框架,平衡快速发展的 AI 技术创新和版权保护,一方面规范生成式 AI 开发者合理使用知识产权,另一方面也…
用LLM合成训练数据,破解自动修Bug的数据瓶颈,思路新颖且实战价值高。
arXiv:2505.07372v3 Announce Type: replace-cross Abstract: This paper presents a novel methodology for enhancing Automated Program Repair (APR) through…
亚马逊为训练AI竟销毁稀有书籍,数据荒时代连绝版书都难逃算法吞噬,值得警惕。
Rare books are incredibly valuable for training LLMs, since these models have already trained on whatever's available online.
AI公司悄悄买空珍本图书引发书商抵制,训练数据背后竟藏着文化毁灭的隐忧。
AI firms quietly bulk buying rare books face resistance from booksellers.
Twitch用户的直播内容一直在喂养亚马逊的AI,如今上线退出选项,背后是AI训练数据的隐私与伦理争议。
Streaming platform says user-generated content "may be used for future Gen AI model improvements."
想弄清大模型究竟“读过”什么?这篇HN讨论带你拆解训练数据溯源难题,手把手理清语言与知识的分界。
I'm really no expert and attempting to come up to speed. But... It strikes me that LLM's are a subtle combination of knowing the language and knowing …
不用猜测模型为何如此输出,用经验性下一词分布为LLM行为溯源到具体训练数据,看懂这一篇就够了。
arXiv:2607.14306v2 Announce Type: replace Abstract: In this paper, we study the connection between an LLM's output distribution and the data used to t…
降维向量能否讲清大模型训练数据?这篇论文给出了实证对比,值得关注。
arXiv:2601.16651v3 Announce Type: replace Abstract: Gradient-based methods for instance-based explanation for large language models (LLMs) are hindere…
马斯克要求AI团队对书籍进行非破坏性扫描,拒绝毁书取数据,兼顾AI训练与版权伦理。
IT之家 7 月 29 日消息,据调查媒体 404 Media 此前报道,人工智能公司正在大量收购稀缺图书,使用切除书脊的高速扫描设备进行数字化,随后将纸质原件粉碎销毁。 IT之家注意到,马斯克昨日转发了这篇报道,并表示: 我已要求 SpaceXAI 团队妥善保存图书馆中的所有珍稀图书,并采用非破坏…
AI公司转向收购旧书获取“纯净”训练数据,背后是版权困境与数据饥渴的行业缩影。
IT之家 7 月 28 日消息,AI 公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。调查媒体 404 Media 最新报道称,多家 AI 公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练 AI 模型,同时避免引发公众舆论反弹。 AI 的发展离不开海量数据…
自动化按样本精细筛选预训练数据,提升大模型训练效率与效果
arXiv:2607.24717v1 Announce Type: new Abstract: Pretraining data processing is critical to the downstream performance of Large Language Models (LLMs).…
谷歌和Reddit用DMCA封杀AI数据抓取遭败诉,法律专家直呼荒谬。
Google's and Reddit's use of DMCA to fight web scraper is bizarre, expert says.
LLM训练数据含GPL代码是否引发“开源传染”?一场关于AI版权与许可证兼容性的思辨。
So, since LLMS are trained on GPLed software, could it be said that they are based on GPL software, activating the "share the source" part of the GPL(…
首个衡量LLM端到端训练数据准备能力的统一基准,填补评估空白。
arXiv:2607.20465v1 Announce Type: new Abstract: The quality of training data fundamentally determines the capabilities of large language models (LLMs)…
AI公司Anthropic因训练Claude使用盗版书籍支付15亿美元和解,91%作者已领赔偿,树立AI版权里程碑。
Article URL: https://apnews.com/article/ai-anthropic-copyright-settlement-claude-books-bartz-74b140444023898aeba8579b6e9f0d63 Comments URL: https://ne…
无需训练数据即可自我进化的搜索代理,突破传统学习范式,实现自主迭代优化。
arXiv:2601.07055v2 Announce Type: replace Abstract: As high-quality data becomes increasingly difficult to obtain, self-evolution without curated trai…
从科幻到现实:用人格数据训练AI,能否通过“老爸版图灵测试”?
In Frederik Pohl's HeeChee series, a pivotal plot element was the idea of committing a human personality to an AI model. Are we there yet? What traini…
AI音乐生成明星Suno被曝利用YouTube数据训练,还隐瞒了安全泄露,行业伦理再敲警钟。
The hacker used an employee's credentials to access source code, which revealed how Suno scraped decades of audio.
出版商和作家组团起诉谷歌,指控其未经授权用版权作品训练Gemini AI,类似案件曾引发天价赔偿,版权与AI的博弈再升级。
IT之家 7 月 15 日消息,一群出版商和作家已对谷歌提起集体诉讼,指控这家科技巨头未经授权使用他们的版权作品训练其人工智能平台 Gemini。 原告方包括 Hachette Livre、Cengage Group、Elsevier、作家 Scott Turow 以及 S.C.R.I.B.E . …