「性能验证」共找到 2637 篇相关文章
在三张圆明园鼠首照片里,我们看到了3D AI的Harness时刻
作者通过三张圆明园鼠首照片开展实测,验证了全新3D AI Harness工作流:通用Agent调度任务、专业3D模型生成、专业软件后处理,仅1.47元即可生成可编辑可交付的3D资产,探讨了3D AI行业的新发展路径。
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
AI+ Kuikly:7.5小时落地三端「多模态聊天 App」实战
腾讯开源的高性能跨端框架 Kuikly,搭配 AI 开发,仅用 7.5 小时交付一套支持 Android、iOS、鸿蒙三端的 AI 聊天 App。介绍了开发过程,包括环境准备、需求分析、编码实现、集成自测、迭代优化和验收复盘,展示了“AI + Kuikly”的高效。
人类最后考试已不够用,Agent最后考试来了!
AI飞速进步,人类最后考试(HLE)已不够用,伯克利牵头推出智能体最后的考试(ALE)。ALE真实、全面、可验证,当前最强AI在最难档通过率仅8.6%,主流系统平均2.6%,显示AI距替人干活尚远。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。
AutoResearch实战:让AI自己训YOLO,mAP从0.729到0.773
本文作者复盘用AutoResearch训练YOLOv8模型全过程。先介绍其要素框架,选YOLOv8 + NEU - DET做实验,经V1轻量验证后升级到V2完整闭环,64轮实验后mAP从0.729提至0.773,还总结工程结论并给出迁移场景建议。
GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。