「动作前缀并行预测」共找到 520 篇相关文章
OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996
OpenAI推出编码杀器Codex桌面App,可指挥多Agent并行协作。它能多任务并行切换,创建调用Skills,设置自动化流程,从写代码进化到解决问题,还具备双人格模式,默认安全,有望重塑开发者与代码交互逻辑。
1000+页PDF解析速度暴涨3倍,MinerU模式不香了
百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。
告别噪声初始化:NTU MARS Lab提出A2A新范式,实现机器人高性能单步动作生成
新加坡南洋理工大学 MARS Lab 提出 Action-to-Action (A2A) Flow Matching 新范式,以历史机器人轨迹为生成起点,打破生成速度与精度瓶颈,在训练效率、推理速度及泛化表现上佳,还可扩展至视频生成领域。
可灵2.5 Turbo太凶残:30%成本暴降+效果飞跃,生成体操动作可去参赛
快手推出可灵2.5 Turbo视频生成模型,在力量感、滞空感和物理感知上进步明显。官方称其在文本响应、动态效果等维度效果提升,高品质模式成本降30%。不过,它在物理认知方面仍有欠缺。
突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知
视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
每天审200个PR、每月3000个Issue?智能体开始并行写代码,人类可能成最薄弱环节
本文是对微软 VS Code 团队工程经理 Kai Maetzel 的访谈。他回顾了 VS Code 发展历程,分享 AI 编程、智能体开发及开发者工具设计的实践思考,如 AI 补全体验优化、智能体开发权衡、与 IDE 交互机制等,还探讨了未来发展挑战与趋势。
拒绝视频生成,深度跃迁提出具身基座模型全新路线
深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
突破视觉仿真算力瓶颈!新一代具身智能仿真框架开源:高吞吐并行高保真渲染助力规模化训练
具身人工智能向以视觉为中心转型,但面临“看得真”和“训得快”难题。清华大学智能产业研究院等提出GS - Playground通用多模态仿真框架,融合高吞吐量并行物理仿真与高保真视觉渲染,成果被RSS 2026录用,将开源。