小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式
小鹏发布 TuringViT,以线性注意力等创新实现“十分之一数据更优效果”,重构视觉大模型训练范式。
IT之家 7 月 21 日消息,小鹏集团今日发布 TuringViT 高效视觉编码器 ,面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。 小鹏集团表示, TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景 ,同时为行业提供了一条可复现…
商汤发布并开源 SenseNova-Vision 理解生成统一视觉大模型,能力超越 Vision Banana
商汤开源统一视觉大模型 SenseNova-Vision,全任务能力超越 Vision Banana,视觉理解与生成实现原生统一。
IT之家 7 月 13 日消息,商汤科技今日发布并全面开源 日日新 SenseNova-Vision 理解生成统一视觉大模型 ,这是商汤日日新大模型体系的重要视觉能力升级。 商汤科技表示,行业以往的 " 统一视觉 " 多是把检测、分割、深度预测等多个专家模型打包封装,本质还是割裂的。SenseNov…
Siri AI at WWDC 2026
苹果Siri将借助视觉大模型“看”屏幕,无需App再写定制代码,AI集成的新思路。
Article URL: https://simonwillison.net/2026/Jun/8/wwdc/ Comments URL: https://news.ycombinator.com/item?id=48456586 Points: 2 # Comments: 0
Siri AI at WWDC 2026
WWDC 2026上Siri将借力视觉大模型从屏幕提取信息,绕过繁琐的应用集成。
Given how badly burned anyone who took Apple's 2024 WWDC Apple Intelligence announcements at face value was, I'm holding to a strict "I'll believe it …
LeCun 10亿押注的方向,全球领先视觉大模型团队早已布局
LeCun豪掷10亿押注的隐空间世界模型,早已被全球顶尖视觉大模型团队抢先布局,揭示世界状态演化的新路径。
”隐空间世界模型很难,但我们一定要做“
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式
快手Keye2.0将DSA注意力引入多模态,在团战识别、旅行攻略生成中展现更细致的推理能力,开启视觉理解新范式。
光影之间,读懂未尽之意
Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs
手写数学也能自动批改?视觉大模型让AI教育再进一步,来自AIED 2026的实证研究。
arXiv:2605.19043v1 Announce Type: cross Abstract: Automated grading systems have enabled scalable assessment for many response types, but handwritten …