阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。 这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 …
IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。 这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 …
用低成本探针方法预测昂贵训练效果,快速筛选3D CT视觉语言模型的最佳编码器和压缩方案。
arXiv:2607.22771v1 Announce Type: new Abstract: Picking the frozen image encoder for a 3D~CT vision--language model (VLM), together with the token-com…
将强化学习搬进虚拟世界,DW0.5让机器人后训练真机数据需求骤降60%、成本降低40%,巧用世界模型作VLA教练。
后训练中真机数据需求骤降60%
1500美元从零训练基础模型?研究团队用超低成本和全新理念挑战“大模型烧钱”的固有认知。
Training a foundation LLM from scratch costs millions and requires internet-scale data — which is why most enterprises don't bother. Sapient thin…
AI算力格局将逆转:推理需求将占70%,智能体交互驱动下,产业整合速度成关键竞争力。
技术创新只是起点,产业整合速度才是AI落地的真正竞争力
颠覆传统,用预训练大模型突破1-bit量化瓶颈,既省存储又保精度。
arXiv:2508.06974v2 Announce Type: replace Abstract: 1-bit LLM quantization offers significant advantages in reducing storage and computational costs. …