「自回归动作世界模型」共找到 1398 篇相关文章
LangChain 不看好 OpenAI AgentKit:世界不需要再来一个 Workflow 构建器
OpenAI发布工具集AgentKit,含可视化画布Agent Builder。LangChain创始人Harrison Chase锐评,市场不需要这种可视化工作流构建器,因其不是真正的Agent构建器,且面临高低复杂度问题挤压。
百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流
百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。
刚刚,Ilya一个神秘动作!OpenAI全员狂欢:AGI来了
Ilya更换X头像和背景封面引发全网猜想,有人猜测SSI内部已实现「超级智能」。另一边,OpenAI研究员集体高呼感受AGI,有人认为取得突破,也有人觉得是跟风刷存在感。
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。
冲击自回归,扩散模型正在改写下一代通用模型范式
Google I/O 2025 开发者大会上,Gemini Diffusion 引发关注,它是采用扩散模型的语言模型。此前已有团队探索扩散式 LLM,如斯坦福、上海 AI 实验室等。蚂蚁集团和人大推出 LLaDA,后发展出多模态模型,国内团队跻身前列。
经典ReLU回归!重大缺陷「死亡ReLU问题」已被解决
在深度学习领域,经典 ReLU 函数因简洁性等优势受青睐,但有「死亡 ReLU 问题」。德国吕贝克大学等机构研究者引入 SUGAR 方法,不牺牲 ReLU 优势解决该问题,还设计 B - SiLU、NeLU 函数,实验显示性能提升显著。
聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?
本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。
Veo何止生成视频:DeepMind正在用它模拟整个机器人世界
通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。
奥特曼下注27岁神秘青年,「复活」世界最顶级实验室
27岁的路易斯·安德烈获奥特曼、孙正义等投资,成立Episteme公司,欲打造现代版贝尔实验室。该公司旨在支持科研者,让其摆脱压力专注研究,虽面临诸多挑战,但也有成功可能。