「物理场景测试」共找到 3794 篇相关文章
老黄刚投的具身智能公司:三个华人创办
Dyna Robotics获1.2亿美元A轮融资,英伟达是新晋股东。该公司由三个华人创立,决定先将具身AGI带入商用场景,今年4月发布可落地商业场景的灵巧操作基础模型DYNA - 1,已在多场景应用。
具身智能迎来“安卓时刻”,一位清华博士决定给机器人换脑|甲子光年
千诀科技CEO高海川讲述其打造的具身智能系统,可脱离特定硬件载体,安装到不同机器人。公司跳出端到端VLA束缚,选分区预测式世界模型,目标是打造“机器人领域的安卓系统”,还认为家庭场景比工业场景易落地。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
Pulsar特性在AI场景中的使用
随着AI发展,架构从单体到分布式演进,消息中间件成关键。Pulsar以存算分离等特性价值凸显,在多模态训练、模型训练、智能体等AI场景有独特优势,如处理超大消息、实现断点续训等。
从算法天才到机器人造梦者,原力灵机范浩强详解具身智能进化论:模型解锁场景,场景定义硬件
AI 前线深度访谈原力灵机范浩强,探讨其创业选择、具身智能技术演进与产业趋势。他认为机器人是 AI 绕不过的点,2025 年硬件与算法拼图开始对齐,原力灵机强调算法先行,还分享了保证算法演进的路线。
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。
Qwen2.5VL又多一个娱乐场景,看电影讲故事
文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。
世界模型的GPT时刻:距离物理AGI出圈,还有多远?
InfoQ《极客有约》X AICon 直播栏目探讨物理 AI 下一个战场。嘉宾认为世界模型未出圈,生成加重建是折中探索。还讨论了其定义、升温原因、数据结构、技术范式、评测标准等,也提及挑战与未来格局。
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。