1
AI 公司被曝大量收购旧书,以获取“纯净”训练素材
AI公司转向收购旧书获取“纯净”训练数据,背后是版权困境与数据饥渴的行业缩影。
IT之家 7 月 28 日消息,AI 公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。调查媒体 404 Media 最新报道称,多家 AI 公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练 AI 模型,同时避免引发公众舆论反弹。 AI 的发展离不开海量数据…
AI公司转向收购旧书获取“纯净”训练数据,背后是版权困境与数据饥渴的行业缩影。
IT之家 7 月 28 日消息,AI 公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。调查媒体 404 Media 最新报道称,多家 AI 公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练 AI 模型,同时避免引发公众舆论反弹。 AI 的发展离不开海量数据…
LLM训练数据含GPL代码是否引发“开源传染”?一场关于AI版权与许可证兼容性的思辨。
So, since LLMS are trained on GPLed software, could it be said that they are based on GPL software, activating the "share the source" part of the GPL(…