「端到端具身大模型」共找到 9034 篇相关文章
FriendliAI获2000万美元,以加速AI模型推理工作负载
专注AI推理的初创平台FriendliAI获2000万美元种子扩展轮融资,资金用于加速平台开发。其专有推理优化技术可降低模型运行成本和能耗,能为用户省90%的GPU成本,合作客户广泛。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
大模型Agent的下一阶段:可自我进化的AI-Agent
在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。
32G内存条从800元暴涨到3800元之后
央视财经报道内存涨价潮席卷全球,从上游芯片制造到下游终端产品均受影响。AI爆发致存储芯片供需失衡,上游厂商利润狂欢,中游方案商转型,下游终端产品成本上升、格局分化,产业进入价值重构新周期。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
数据蒸馏的双重突破:从几何保真到对抗鲁棒
深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。
PolyVivid实现多主体视频定制,身份一致性超越现有模型
现有视频生成模型在多主体定制中难保持身份一致与自然交互,上交和腾讯提出PolyVivid框架解决此问题。它在多方面优于现有方法,还介绍技术原理、演示效果,证明其在多领域有实用价值。
从「自我进化」到「DAA」,百度给出 Agent 时代系统答案
2026 年 AI 行业发展微妙,模型能力增强但转化为生产力的企业不多。Create 2026 上百度给出两层答案,构建系统能力,提出 DAA 度量 AI。这是过去三年判断的收束,将非共识整合成面向 Agent 时代的方法论。
GPT-image-2十大最强玩法实操:夯到爆炸
OpenAI全量上线GPT Image 2,其表现远超其他模型。它优势明显,如真实感与细节强、文本渲染准确、自带“思考”能力。文章还给出其十大玩法实操及提示词,涵盖图文组合、海报生成等。
DeepMind 发布超真实世界模型 Genie 3,AGI 向前一步
谷歌旗下DeepMind发布通用型世界模型Genie 3,可通过文本提示生成动态世界并实时交互,其生成内容物理一致性达分钟级。它功能丰富,也受业内好评,但有行动空间有限等局限,对迈向AGI意义重大。