Multimodal Model Diffing for Feature Discovery and Control
用模型差分法定位多模态模型内部特征,实现精准控制与可解释性,干货满满。
arXiv:2608.09928v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) exhibit strong visual understanding, yet the internal featu…
用模型差分法定位多模态模型内部特征,实现精准控制与可解释性,干货满满。
arXiv:2608.09928v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) exhibit strong visual understanding, yet the internal featu…
音频大模型也难逃越狱攻击?GRM通过梯度比掩蔽实现效用感知攻击,兼顾攻击效果与音频质量,为多模态AI安全防御敲响警钟。
arXiv:2604.09222v2 Announce Type: replace-cross Abstract: Audio Large Language Models (ALLMs) enable spoken interaction but introduce new jailbreak vu…
前海母基金数亿元押注,端侧原生物理AI模型开源,Om AI联汇加速商业化落地。
商汤开源轻量级多模态模型,原生4K图像生成,性能多项超越上代,开源社区可玩。
IT之家 8 月 3 日消息,商汤科技今日宣布,面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。 ▲ SenseNova U1.5-Lite-Preview 生成 据介绍,得益于多项能力强化,U1.5-Lite-Preview 在多项主流生成 / …
小米 MiMo Code 免费时代即将落幕,7月26日起收费,背后还有组织架构调整与新版模型发布,开发者需注意。
IT之家 7 月 23 日消息,小米 MiMo 官方今日宣布, 自 7 月 26 日 18:00 起,MiMo Code 将结束免费使用阶段 。 据介绍,限免结束后,用户可前往 Xiaomi MiMo API 开放平台订阅 Token Plan,继续享用 MiMo Code。 首次订阅 Token …
2026上半年AI发展回顾:创新井喷但方向混乱,Agent Swarm等模型凸显失控风险。
Article URL: https://jatniel.dev/en/bytes/six-months-of-ai-in-2026-and-a-whole-lot-of-noise Comments URL: https://news.ycombinator.com/item?id=4858147…
早录MICCAI 2026,提出统一多模态模型同步实现脑MRI数据补全与理解,打通医学影像分析新路径。
arXiv:2606.16484v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) hold great potential for medicine, as they inherit knowledg…
大型多模态模型的提示检索新方法,利用用户反馈动态优化提示,提升生成质量与适应性。
arXiv:2606.12744v1 Announce Type: new Abstract: In-Context Learning (ICL) has become a powerful mechanism for adapting Large Language Models (LLMs) to…
在arXiv上追踪前沿AI病理图像研究,一键访问最新多模态论文
arXiv:2511.19652v2 Announce Type: replace Abstract: Recent advances in large multimodal models have allowed for the development of interactive chat mo…
小米开源探索性AI编程助手MiMo Code v0.1.0,基于OpenCode二次开发,支持多模态模型与语音控制,采用MIT协议。
IT之家 6 月 11 日消息,小米 MiMo 官方今日凌晨正式发布并开源 MiMo Code V0.1.0 —— 一款运行在终端里的探索性 AI 编程助手。 据介绍, MiMo Code 基于开源项目 OpenCode 二次开发,发布并开源,采用 MIT 协议 。它还内置限时免费多模态模型 MiM…
生理信号增强胸部X光自编码器,多模态基础模型新突破,被ICML 2026 Workshop接收。
arXiv:2606.01537v1 Announce Type: cross Abstract: Clinical diagnosis often requires combining imaging with physiological measurements, yet deployed mo…
无需昂贵训练与冗长思维链,探索视频推理的高效新路径。
arXiv:2510.17045v2 Announce Type: replace-cross Abstract: Video reasoning using Large Multimodal Models (LMMs) relies on costly reinforcement learning…
首个针对多模态大模型物理推理的台球基准,测试从静态图预测动态的能力
arXiv:2605.30900v1 Announce Type: new Abstract: Current multimodal models handle static image recognition well, but intuitive physical reasoning remai…
MiniMax从Token无上限到全员Agent,揭秘AI Native组织的进化实践与多模态模型布局
与其焦虑AI,不如加入AI
首次提出全预训练的统一多模态模型Archon,融合文本、音频、动作与视觉,实现数字人整体生成。
arXiv:2605.30311v1 Announce Type: cross Abstract: Digital humans are fundamental to immersive interaction, yet creating a unified model for holistic m…
梅涛揭秘多模态模型毛利率远超语言模型,商业路径清晰可见。
文|王欣逸 李嘉星 编辑|周鑫雨 一家Day 1就在做多模态大模型的公司,无法拒绝参与到具身智能和世界模型热潮之中。 2026年,随着Seedance 2.0、GPT Image 2.0等模型的爆火,多模态能力越来越成为行业内绕不开的关键词。5月19日,智象未来首届开放日上,智象未来给出了他们的判断…
让多模态模型通过“想象”进行视觉思维,大幅提升空间推理能力,新方法开源并实验验证。
arXiv:2605.27310v1 Announce Type: new Abstract: Cross-view spatial reasoning remains a weak spot for vision-language models (VLMs): they often reason …
网易有道重磅开源“子曰4”多模态模型与TTS模型,教育场景数理能力达行业顶尖,支持14种语言,单卡即可运行。
IT之家 5 月 22 日消息,网易有道今日宣布,决定将“子曰”大模型 4.0 的核心双引擎 ——“多模态模型”与“语音合成(TTS)模型”, 正式面向全球全量开源 。开发者可以免费下载、部署,并基于此进行二次开发。 此次开源的“子曰 4”多模态模型(27B 参数规模)面向教育场景,支持视觉输入的数…
提出在任务无关世界模型中强化VLA的方法,提升模型泛化能力与样本效率。
arXiv:2605.12334v2 Announce Type: replace Abstract: Post-training Vision-Language-Action (VLA) models via reinforcement learning (RL) in learned world…