大模型架构」共找到 9968 篇相关文章

新闻资讯7

刚刚!Thinking Machines Lab | 长文揭开LLM推理不确定性真相!

Thinking Machines Lab发布《克服LLM推理中的不确定性》,揭示语言模型推理不确定性原因,并非“并发 + 浮点”假设那么简单,主要是负载及batch size不确定所致,还给出让核函数有批次不变性的方法及实验结果。

AINLPer
算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
开源动态8

3A作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化

阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。

机器之心
产品应用8

RoboScience机器科学发布轮式仿人形通用机器人REX G1,让机器人真正成为新一代具身生产力伙伴|甲子光年

8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1,搭载自研的Visics通用具身模型,面向多场景打造,能完成完整任务闭环。它将移动与操作融合,适应真实环境,具强泛化能力且续航佳。

甲子光年
新闻资讯7

独家 | 华为天才少年楼燚航离职创业,要做 200B 以上的「具身脑」

前华为“天才少年”楼燚航离职创立引力蓝移,定位构建具身脑。其采用分层架构,认为具身智能Scaling拐点已至,规划了数据来源和模型参数规模。正与汇川合作,按24个月规划推进,面临产品验证挑战。

AI科技评论
新闻资讯8

独家|「中科第五纪」完成数亿元A轮融资,率先开启海外商业落地

AI科技评论独家消息,具身智能企业「中科第五纪」近日完成数亿元A轮融资,年内已完成三轮。该公司还收获海外数亿订单。其提出超少样本具身操作模型等核心技术,形成完整技术体系。

AI科技评论
推荐文章7

我觉得“Agent”这个词,现在终于有了一个家都认可的定义了

作者Simon Willison认为现在‘Agent’有了家认可的定义,即一个AI Agent是为实现目标循环调用工具的语言模型。还分析了此前难统一定义的情况、‘工具循环实现目标’含义,指出不同人群对‘Agent’理解有偏差。

宝玉AI
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?

小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ
产品应用9

我给阶跃星辰 Step 5 Preview 出了一道工程题

本文作者池建强参与阶跃星辰新一代旗舰模型Step 5 Preview小范围内测,设置带两层bug和隐藏需求的编码工程题,与Qwen 3.8 Max、Kimi K3对比测试,分享实际项目使用体验,给出客观评测。

MacTalk
开源动态9

告别「只会相似度检索」:腾讯最新T-Mem让AI学会「联想回忆」

当前语言模型长期记忆方案均基于相似度检索,存在结构性盲区,无法在无字面/语义相似时召回关联记忆。腾讯团队提出T-Mem,实现AI联想回忆,已被EMNLP 2026接收,代码开源并上线QQ AI伙伴。

机器之心