派早报:智谱开源 GLM-5.3-Flash 原生多模态模型等
Perplexity AI 推出 Portable Computer,明基推出 Creative Pro PV50 系列专业显示器。 查看全文
Perplexity AI 推出 Portable Computer,明基推出 Creative Pro PV50 系列专业显示器。 查看全文
IT之家 8 月 26 日消息,智谱今晚上线并开源 GLM-5.3-Flash (320B-A18B),这是 GLM-5 系列的首个原生多模态模型。该模型总参数量为 320B(3200 亿),激活参数仅 18B(180 亿)。 智谱在正式发布前,以匿名模型 Ox-Alpha(中文社区称作牛来)在 O…
阿里千问明晚开源基于Qwen4架构的多模态MoE模型Qwen3.8-Flash-Next,新一代架构值得期待。
IT之家 8 月 25 日消息,魔搭社区(ModelScope)显示,阿里千问 Qwen3.8-Flash-Next 模型将于北京时间 08 月 26 日 23:00 开源。 页面显示,阿里千问将发布 Qwen3.8-Flash-Next 和 Qwen3.8-Flash-Next-FP8 两个版本模…
多模态大模型如何自主规划工具生成图文交织内容?首个基准ATP-Bench来了。
arXiv:2603.29902v2 Announce Type: replace Abstract: Interleaved text-and-image generation represents a significant frontier for Multimodal Large Langu…
破解AI看病难题:全新基准MedReaMM如何考核多模态大模型的专业诊断整合能力
arXiv:2608.22323v1 Announce Type: new Abstract: The application of Large Language Models (LLMs) to diagnostic decision-making has garnered growing int…
首个聚焦音视频大模型安全性的基准,曝光跨模态越狱漏洞,为多模态安全研究提供关键测试标准。
arXiv:2508.07173v3 Announce Type: replace Abstract: Omni-modal Large Language Models (OLLMs) that integrate visual, auditory, and textual processing f…
用多模态检索加约束重排搞定音乐对话推荐,参赛方案干货满满,值得算法人细读。
arXiv:2608.23484v1 Announce Type: new Abstract: We present Team Semiintelligencn's solution for the ACM RecSys 2026 TalkPlayData Challenge, addressing…
多模态大模型不止看懂RGB,高光谱成像理解迎来全新基准与免训练推理框架。
arXiv:2604.08884v2 Announce Type: replace-cross Abstract: Multimodal Large Language Models (MLLMs) have achieved strong performance on RGB image under…
揭秘多模态大模型在持续学习中的公平性后门攻击,锚定偏差如何悄然埋下隐患。
arXiv:2608.21577v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed in high-stakes domains where fair…
多模态大模型解码新思路:用语义锚点驱动聚类生成,让长文本输出更连贯,EMNLP 2026 已收录,值得跟进。
arXiv:2608.22367v1 Announce Type: new Abstract: Diffusion multimodal large language models (dMLLMs) frequently produce long-form outputs marred by sem…
无需训练的多模态大模型流水线,精准解析微动作语义,ACM Multimedia 2026亮点工作
arXiv:2608.21022v1 Announce Type: new Abstract: Micro-actions are subtle, short, low-amplitude body movements, such as a fidgeting hand or a slight he…
2.8万亿参数开源模型Kimi K3发布,刷新开源规模纪录,月之暗面大模型新里程碑。
IT之家 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣布, 其第一代万亿参数多模态模型 —— Kimi K2.5 本月底即将结束服役 。 据IT之家此前报道, 今年 1 月,月之暗面宣布推出并开源了其最新的 Kimi K2.5 模型 。同时,Kimi 智能助手 K2.5 版本正式上线。用…
仅用16GB内存的Mac Air跑起MiniMax H3 33B视频模型,5天跟进开源权重的轻量多模态工具链。
Article URL: https://github.com/tgo-app-dev/vpipe Comments URL: https://news.ycombinator.com/item?id=49397410 Points: 1 # Comments: 0
商汤开源8B多模态大模型,原生4K图像输出,轻量却媲美超大规模商业模型
IT之家 8 月 21 日消息,商汤科技今日宣布 开源轻量级、原生统一 多模态 大模型 SenseNova U1.5 Lite。 据介绍,SenseNova U1.5 Lite 原生支持 3-4k 上下文长度 ,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,提升复杂视觉任务的执行稳定…
DeepSeek新一代多模态模型上线,API接入更灵活,Agent能力逼近顶尖水平,值得开发者关注。
IT之家 8 月 21 日消息,深度求索官方刚刚宣布全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台。 该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF…
AI克隆不仅会说话,更要会倾听?看多模态交互如何用点头和回馈信号构建更自然的人机对话。
arXiv:2608.19527v1 Announce Type: cross Abstract: AI clones that imitate a specific person typically reproduce what the person says and how they sound…
提出MR-IQA-2,用细粒度信用分配让多模态大模型在图像质量评估中的推理更忠实。
arXiv:2608.18579v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) have shown strong potential for image quality assessment (I…
用通用多模态大模型把深度伪造检测变成可解释的感知工具,让AI“说”出造假痕迹。
arXiv:2608.18573v1 Announce Type: new Abstract: Existing explainable deepfake forensic methods typically rely on task-adapted MLLM to jointly address …
MiniMax Design发布,H3多模态视频模型开源商用,2K分辨率加音乐生成,AI创作生产力全面释放。
IT之家 8 月 20 日消息,MiniMax 今日发布多模态创作 Agent 工作台 MiniMax Design,进一步释放原生多模态视频模型 H3 的生产力,推动模型能力进入商业内容生产流程。 据IT之家了解,MiniMax Design 是一款多模态创作 Harness。用户提出创作需求后,…