Training Proactive and Personalized LLM Agents
让大模型从“被动应答”走向“主动服务”,教你训练会察言观色的个性化AI代理,附完整方法框架。
arXiv:2511.02208v2 Announce Type: replace Abstract: Despite rapid progress, current AI agents are primarily optimized for isolated task completion. We…
让大模型从“被动应答”走向“主动服务”,教你训练会察言观色的个性化AI代理,附完整方法框架。
arXiv:2511.02208v2 Announce Type: replace Abstract: Despite rapid progress, current AI agents are primarily optimized for isolated task completion. We…
实时围观535B参数MoE大模型训练全过程,看18T token扩展阶梯如何一步步炼成。
Article URL: https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng Comments URL: https://…
应对大模型智能体强化学习训练中的故障难题,为长时训练提供高效容错保障,值得关注。
arXiv:2608.14635v1 Announce Type: cross Abstract: Large language model (LLM) agents are increasingly trained with reinforcement learning in long-horiz…
从零训练三个大语言模型,并放上线供你亲自试玩,体验AI训练成果。
Article URL: https://huggingface.co/spaces/JohnEnev/modern-llm-playground Comments URL: https://news.ycombinator.com/item?id=49299726 Points: 2 # Comm…
AI公司自研芯片,训练AI设计芯片的岗位薪资竟比造芯工程师高一倍多,折射人才争夺新趋势。
IT之家 8 月 7 日消息,据 Wccftech 今日报道,Anthropic 目前正在扩大内部芯片设计团队,并计划开发自研 ASIC 芯片。 与此同时,公司不同芯片相关岗位之间出现了明显的薪资差异:负责训练 AI 模型进行芯片设计的研究工程师岗位,年薪最高可达 85 万美元 (IT之家注:现汇率…
MoE训练新方案:Sinkhorn梯度下降替代AdamW,减少优化器状态内存,让大模型训练更省显存。
arXiv:2608.04407v1 Announce Type: cross Abstract: Memory-efficient matrix optimizers such as Sinkhorn gradient descent remove most AdamW optimizer sta…
学习率如何抑制灾难性过训练?这项研究揭示关键调节机制,为深度学习训练提供全新视角。
arXiv:2604.13627v2 Announce Type: replace Abstract: Supervised fine-tuning (SFT) is a common first stage of LLM post-training, teaching the model to f…
把 Transformer 参数与激活约束到超球面,nGPT 带来表示学习新范式,一文看懂归一化训练的关键设计。
arXiv:2608.01284v1 Announce Type: cross Abstract: The normalized Transformer (nGPT) realizes hyperspherical representation learning by constraining mo…
解耦LLM后训练中的GPU资源瓶颈,用强化学习实现运行时动态分配,大幅提升算力利用率。
arXiv:2607.22614v2 Announce Type: replace Abstract: RL-based LLM post-training increasingly disaggregates Rollout and Training across separate GPU res…
大规模指令语料库发布,含近23万文件,可自由用于模型训练与评测。
The TomeVault Instruction Corpus De-identified structural measurements of AI instruction files (CLAUDE.md, AGENTS.md, SKILL.md, .cursorrules and relat…
科技巨头面临两难抉择:AI算力是自用训练模型还是出租给客户赚钱?Meta、微软、谷歌的最新财报观点揭秘算力分配内幕。
IT之家 7 月 30 日消息,随着科技巨头大举建设算力基础设施,以满足 AI 热潮带来的需求,一些企业正面临一个棘手的问题:究竟应该把算力留给自己使用,还是拿出来出售赚钱? IT之家注意到,Meta CEO 马克 · 扎克伯格本周在公司第二季度财报电话会议上谈到了这一问题。虽然 Meta 目前没有…
挑战传统认知:弱教师如何高效指导强学生?这项研究提出了弱到强的在线策略蒸馏新范式。
arXiv:2607.26246v1 Announce Type: new Abstract: On-policy distillation (OPD), which aligns a student with the teacher's token-level distribution on th…
论文提出利用专家系统(游戏引擎、规划器等)的输出作为推理数据,突破人工标注或蒸馏的局限,为LLM推理训练开辟新路径。
arXiv:2607.21856v1 Announce Type: cross Abstract: Modern reasoning models depend on reasoning data, today sourced from human annotations or distilled …
AI产业正从模型训练转向推理落地,超擎数智CEO详解全栈方案如何加速企业智能化,未来6-12个月将迎爆发式增长。
7月17日,2026世界人工智能大会在上海开幕。作为36氪连续第三年深入WAIC现场的重要内容窗口,「氪话未来」直播间也在大会首日同步开启现场对话。超擎数智创始人兼CEO唐春峰在WAIC现场接受36氪「氪话未来」特邀专访,围绕人工智能推理应用落地、软硬一体全栈解决方案、行业应用实践等话题,分享了超擎…
小鹏发布 TuringViT,以线性注意力等创新实现“十分之一数据更优效果”,重构视觉大模型训练范式。
IT之家 7 月 21 日消息,小鹏集团今日发布 TuringViT 高效视觉编码器 ,面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。 小鹏集团表示, TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景 ,同时为行业提供了一条可复现…
提出归一化奖励方法,提升偏好优化训练稳定性与效果
arXiv:2607.16240v1 Announce Type: cross Abstract: Direct Alignment Algorithms (DAAs) such as DPO have become a common way to post-train and align LLMs…
用自蒸馏技术增强基于评分标准的强化学习,提升训练效果和泛化能力。
arXiv:2607.18082v1 Announce Type: cross Abstract: Rubric-based RL has recently shown promise in improving LLMs on open-ended tasks. A widely recognize…
马斯克官宣Grok 4.6下周完成初始训练,2万亿参数规模碾压前代,AI竞赛再提速。
IT之家 7 月 18 日消息,埃隆 · 马斯克(Elon Musk)今日在 X 上回复网友时透露,xAI 正在训练中的下一代 Grok 4.6 模型参数规模将达到 2 万亿,预计将在下周完成初始训练。 马斯克表示,2 万亿参数模型在各方面都优于当前的 1.5 万亿参数版本,同时推理速度和 Toke…
沐曦新发布的曦景S600实现单机柜64卡高密度部署,并可灵活扩展至万卡集群,专为大模型训练推理和智算中心打造。
IT之家 7 月 18 日消息,2026 世界人工智能大会(WAIC 2026)今天在上海举行, 沐曦股份在大会期间正式发布新一代 AI 超节点新品曦景 S600 。 IT之家从沐曦股份公众号了解到,曦景 S600 是面向大模型训练、推理及智算中心建设打造的系统级算力产品,可实现单机柜 64 卡高密…
一文对比RLHF与DPO两种主流大模型训练方法的核心差异与适用场景
In this article, we will look at how that learning actually happens, starting with why instruction-following alone falls short, then walking through t…