「混合专家模型」共找到 8134 篇相关文章
Qwen3.8-Flash:全新架构,更强更稳更划算
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
ResNet作者任少卿机器人创业!公司注册就独角兽了
知名AI科学家任少卿创立物理AI基础模型和具身智能独立公司,估值达独角兽级别。他虽创业仍在职蔚来,蔚来战略投资并合作。任少卿是业内早押注世界模型实战派,其创业或可视为蔚来机器人试水。
波士顿动力机器人终于有脑子了!人类故意使绊子也不怕
波士顿动力与丰田研究院联手基于大型行为模型,推出Atlas全新版本Atlas MTS。它能听懂自然语言指令、自主规划动作、处理意外。此次升级采用特定模型及策略,还结合VR界面。此外,波士顿动力转向电驱,电驱机器人时代将来临。
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4
近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
The Batch: 883 | 美国两个州禁止人工智能驱动的心理健康治疗
美国伊利诺伊州成继内华达州后,第二个禁止用人工智能进行心理治疗的州。该法案限制聊天机器人独立治疗及其他AI使用方式,旨在保护患者和人类治疗师,但也引发对全面禁止利弊的讨论。
刚刚,DeepMind经典巨作再封神!ICML 2026大奖公布
ICML 2026大奖公布,杰出论文奖中两篇扩散模型论文获奖,立场论文奖指出AI安全工具被挪用问题。时间检验奖颁给DeepMind经典论文。获奖名单显示扩散模型研究热,AI安全需审视,AI研究进入深度清理阶段。
5Y News|GIM 完成数千万元天使轮融资
日前,GIM宣布完成数千万元天使轮融资,由五源资本与Monolith投资。资金用于自研金融大模型迭代等。其定位自进化智能体投资平台,已推自研金融时序大模型,未来将推基金策略与产品。
JCP | 南科大邹欣桐、王建春等:神经算子在三维湍流预测中的不确定度和稳定性分析
本文以三维各向同性湍流为例,提出面向神经算子的可信度评估框架,考察预测误差不确定度、长时迭代稳定性及流场时间相关性对模型可靠性的影响。结果显示,物理约束和合理时间步长可提升模型稳定性与可靠性。
Wan2.2-Animate又火了,5分钟让抠脚大汉秒变高冷女神。
阿里开源模型Wan2.2 Animate又火了,用照片和视频就能生成换脸视频,表情动作复刻佳。它上限高,还能变声,可用于舞蹈视频、影视二创等,但手指易崩坏。模型开源,有积极意义也有风险。