「多模型推理」共找到 10009 篇相关文章
突破遥操瓶颈!全新无本体数据世界动作模型Noe-0发布
穹彻智能发布世界动作模型 Noe - 0,全链路采用无本体采集数据。其数据来自真实环境,配合 World Action Model 架构和 AI - Native 数据基础设施,跑通从真实世界经验到机器人能力转化的完整链路,是具身智能的里程碑。
ChatGPT默认模型大升级,GPT-5.5 Instant正式上线:新增记忆来源功能
OpenAI宣布ChatGPT默认模型升级为GPT-5.5 Instant,面向所有用户开放。升级核心是准确性,在高风险领域幻觉内容减少,能力全面提升,回复更简洁。还提升了个性化能力,引入记忆来源功能。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
微软、哈佛开源创新优化器:全面超越Muon,提升大模型训练效率
随着大模型训练所需计算资源爆炸式增长,微软和哈佛团队联合开源优化器Dion。它利用低秩近似和解耦动量缓冲区,避免分布式训练同步完整梯度,在集中式和分布式场景都有高效表现,性能超Muon。
百度端侧大模型安全建设实践:在算力与保障之间找到平衡
在 QCon 全球软件开发大会上,百度李志伟分享端侧大模型安全建设实践。介绍其发展趋势、优势与应用场景,指出面临隐私、内容等安全挑战,阐述云端与端侧安全方案,通过案例展示优化效果,展望未来安全建设方向。
开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践
OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。
微软:LLM上下文学习并非真的学习!
微软研究指出大模型上下文学习(ICL)虽数学上符合学习定义,但只是拟合prompt内统计规律,非掌握任务本质。通过大量实验,得出如例子越多模型表现越好、语言不重要统计重要等7条关键发现。
刚刚,谷歌发布机器人最新「大脑」模型!思考能力SOTA,还能「跨物种」学习
谷歌旗下DeepMind发布Gemini Robotics 1.5系列模型,包括Gemini Robotics 1.5和Gemini Robotics - ER 1.5,能让机器人学会‘思考’,还可跨具身形态学习技能,有望开启通用机器人新时代。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。
OpenDev:破解AI编程指令衰减难题
当下AI编程工具竞争激烈,大多存在闭源或绑定单一模型的问题。OpenDev是开源的终端AI编程Agent,用Rust编写,仅3.7MB。其论文详细解释设计决策,给出指令衰减问题的工程解法,还有多种实用设计。