「视频渲染框架」共找到 2553 篇相关文章
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025
来自多高校研究团队提出KineDex框架,以真·手把手指导方式让人类动作传至灵巧手,同步采集高保真触觉信息,使星动纪元灵巧手星动XHAND 1解锁复杂精细操作,论文已被CoRL 2025接收。
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线
近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。
Agentic AI 要终结数据库和 SaaS?大厂掌门人公开互撕,焦虑的 CEO 们押上了不同的技术路线
2025年Agent成AI热词,科技巨头与初创公司纷纷布局。微软和Salesforce掌门人公开“互呛”,代表两种不同落地路径。前者主张通用框架,后者强调垂直集成。当前二者Agent均有落地,但面临技术、成本等挑战。
追更太累,桌面版AI帮我把 OpenClaw 的剧情补齐了
作者因OpenClaw信息爆炸跟不过来,想到让AI帮忙。介绍了AI播客自动化案例及Cowork短板,引出天工Skywork桌面版。用其处理视频、监控AI社区,还构建安全屏障,该工具打通内容创作和信息监控闭环。
美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破
美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越大模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。
TileLang vs Triton 详解:谁该握住控制面——编译器还是开发者?
文章对比 TileLang 与 Triton 两个框架,解释控制面设计、并发协议、编译管线的本质差异,以及这些差异如何影响性能上限、工程投入。明确 TileLang 追求榨干内核,性能上限高但对开发者要求高;Triton 追求快速落地,生态成熟。
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐
北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。