「魔法大模型3.0矩阵」共找到 8813 篇相关文章
蚂蚁C2LLM:基于注意力池化的代码检索新范式
在Code RAG场景中,传统文本Embedding模型处理代码表现欠佳。蚂蚁集团与上海交通大学联合发布C2LLM系列模型,引入注意池化模块,在MTEB - Code榜单表现出色,还得益于优质训练流程,成果已回馈社区。
奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”
强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。
双重突破:全球首个零售VLA大模型来了!开源OpenWBT让机器人遥操门槛暴降!
2025北京智源大会上,银河通用机器人展示端到端具身大模型GroceryVLA,可在商超场景自主操作,具强适用性等五大能力。还发布OpenWBT开源系统,降人形机器人遥操门槛,促产业发展。
代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。
中山大学HCP Lab联合拓元智慧提出高效世界模型DDP-WM,机器人规划效率提升9倍
中山大学人机物智能融合实验室联合拓元智慧提出新型高效世界模型框架DDP - WM。它解耦动态预测,在提升推理速度同时,提高规划成功率,如Push - T任务规划速度提9倍、成功率从90%升至98%。
图灵奖得主杨立昆现场追问:AI 还没越过这 3 道认知墙,谈什么通用智能?
图灵奖得主杨立昆指出AI未越过三道认知墙,即看不懂物理世界、无长时记忆、无推理结构,提出JEPA架构及AMI概念,还建议别卷模型,应卷架构,如探索具身智能等领域。
把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流
本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频转为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。
腾讯祭出开源核弹!LeVo音乐生成模型,媲美Suno,支持零样本风格迁移,歌词完美匹配
音乐生成领域有重大突破,腾讯AI Lab开源高保真音乐生成模型LeVo。它由LeLM和音乐编解码器组成,能解决现有方法在音质、音乐性等方面的局限,实验显示其优于现有方法,功能强大且适用场景多。
Google全链路赋能出海:3人团队调度千个智能体,可成独角兽|MEET2026
在量子位MEET2026大会上,Google Cloud大中华区负责人Dennis Yue称智能体为初创出海注入新内涵。谷歌推一体化方案全链路赋能,还谈到Gemini 3突破、A2A协议及商业模式转变等。