互联网视频数据」共找到 3405 篇相关文章

算法论文8

π0.7来了!涌现出组合泛化、跨本体迁移能力,VLA又行了?

具身赛道玩家 Physical Intelligence 发布新模型 π 0.7,它展现出组合泛化和跨本体迁移能力,还能通过知识蒸馏学会优化技巧。其强大源于杂数据和细提示,未来有望解决复杂任务。

机器之心
产品应用7

MMX-CLI给AI Agent装上七种感官,内容创作更方便

MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。

AI工程化
推荐文章7

自动驾驶优化:从复杂性到实时工程

本文深入探讨自动驾驶技术栈端到端架构,阐释从上下文感知传感器融合到MPC求解器等优化技术,如何将原始传感器数据转化为安全控制指令,还介绍轨迹规划、实时计算预算及调试等内容。

InfoQ
产品应用7

Claude Cowork 推出新功能 Dispatch:Claude 从此开启「异地办公」

Anthropic为Claude Cowork推出新功能Dispatch,能让用户用手机给电脑上的Claude派任务。它代码本地运行,保障数据安全,还支持持久对话。目前已对Max订阅用户上线,不过存在多设备支持等问题。

AGI Hunt
产品应用7

Skills 真的可以帮我干活了:把工单分析变成一个可复用的 Skill

Anthropic推出Skills时未被看好,Claude Code2.1.3版本解决触发难题。作者将工单分析固化成可复用Skills,指出传统思路获取数据难,提出新方案,还对比了Skills和Workflow,强调前者优势。

阿里云开发者
算法论文8

CMAME|美国西北大学,德州大学|Wing Kam Liu及 TJR Hughes 等: LLM赋能的下一代计算机辅助工程

工程仿真里有限元方法常见,但计算与人力成本高。此研究提出把大语言模型变为计算机辅助工程智能体,开发不依赖训练数据的降阶求解器,在多问题上表现佳,为下一代计算机辅助工程提供框架。

力学与人工智能
推荐文章7

AI一边平权,一边拉开差距

互联网大佬爱讲“AI平权”,却没说AI变强、获知识门槛降低时,人和人差距反而拉大。决定差距的关键是提问力等三个能力,真正的提问力是对问题“形式化定义”的能力。

newtype AI
算法论文8

邱锡鹏团队新作:让机器人学会「察言观色」

复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。

AI科技评论
开源动态8

世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana

北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。

量子位
产品应用8

豆包背后的“超算大脑”:字节ByteRobust系统跑20多万张GPU,性能刷新SOTA

字节跳动自研的ByteRobust系统登上SOSP 2025,部署于超20万张GPU平台,9600张GPU训练三个月ETTR达97%。该系统应对LLM训练故障,由控制和数据平面构成,能自动发现修复故障,提升训练效率与稳定性。

AIGC开放社区