模型能力」共找到 8909 篇相关文章

新闻资讯7

“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将大淘汰,拼的是世界模型

InfoQ采访真机智能刘智勇,探讨具身智能领域进展、技术瓶颈及商业方向。刘智勇指出,VLN技术有进展但导航成功率待提升,世界模型可提升机器人能力,2026年本体厂商将收缩,盈利是核心。

InfoQ
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
推荐文章7

我用大模型砌“屎山雕花”:5天肝出几万行代码!产品经理的AI编程翻车记

作者作为非技术背景的产品经理,分享用大模型编程经历。先借 MCP 搭建应用,后 5 天产出大量代码却问题多。经三次重构领悟协作方法,还总结沟通技巧,指出 AI 编程改变产品经理工作,未来需融合多角色能力

InfoQ
产品应用8

非Transformer架构落地之王,带着离线智能和原生记忆能力在上海WAIC浮出水面

在上海WAIC现场,RockAI展台的机器狗和灵巧手在离线状态表现出色,背后是其非Transformer架构的大模型Yan 2.0 Preview,有原生记忆和离线智能能力。该公司成立两年,押注此架构,产品已商业落地,还构想群体智能未来。

量子位
新闻资讯8

被“网暴”两个月后,Yann LeCun 携最新世界模型杀回!小扎千万美元激励抢人,Meta AI 内部权利之争开始

Meta推出新的“世界模型”V-JEPA 2,可提升AI物理推理能力。它是V-JEPA扩展版,在百万小时视频上训练,能让机器人完成任务。Meta还发布三项基准测试,且已开源。LeCun力挺,小扎为追进度亲自招人才。

AI前线
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
算法论文7

英伟达放话:小模型才是Agent的未来!

英伟达论文指出,当前用大模型构建AI Agent是资源浪费,提出小模型才是Agentic AI未来,给出三点理由,还提供从大模型迁移到小模型的六步流程,并分析三个开源项目,呼吁行业追求效能。

探索AGI
开源动态7

一文彻底搞懂 MCP:AI 大模型的标准化工具箱

MCP(模型上下文协议)是 Anthropic 于 2024 年 11 月开源的新技术,是 AI 大模型的标准化工具箱。它能让大模型与外界互动、获取信息、完成任务,整合 Function Call 标准,几乎所有大模型都可接入。

机器学习AI算法工程
新闻资讯7

全球开源大模型,前十五名全是中国的

近日,随着新一代大语言模型更新,开源大模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源大模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。

机器之心