「商业验证」共找到 1157 篇相关文章
从工具到生命形式:OpenClaw 引发的 Agent 再思考
InfoQ《极客有约》X QCon 直播邀业内专家探讨 OpenClaw 落地难点。专家认为,这波 Agent 热潮验证了复杂工作可被系统承接,也指出 OpenClaw 虽非生产级产品,但推动了全民 Agent 浪潮,同时探讨了模型与编排层结合、记忆系统等问题。
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
人类最后考试已不够用,Agent最后考试来了!
AI飞速进步,人类最后考试(HLE)已不够用,伯克利牵头推出智能体最后的考试(ALE)。ALE真实、全面、可验证,当前最强AI在最难档通过率仅8.6%,主流系统平均2.6%,显示AI距替人干活尚远。
九章云极发布AI工厂体系:破解140万亿Token时代的落地悖论|甲子光年
九章云极于6月17日发布Alaya NeW AI工厂体系,锚定十万P算力、十万亿Token、千个模型、千倍降本四大目标。该体系是智能工业化的必然产物,能解决资源难转生产力的难题,还具备技术效能、生态范式和商业飞轮三大支柱。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
苹果提出新型反向传播:一台iPhone 15 Pro Max就能微调LLM
苹果提出内存高效型反向传播(MeBP),可在内存使用量和计算时间上比零阶优化(ZO)有更好权衡,收敛更快、性能更优,还在iPhone 15 Pro Max验证其有效性,且公开了实现链接但目前为空。
「注意力经济」下,AI 生活助手能否解锁生服「新」刚需?
今年不少国内大厂加码AI生活助手赛道。腾讯、阿里、美团、京东、滴滴等各有动作,如腾讯在微信上线「元宝」,阿里在电商业务开发助手。当前AI应用使用时长和留存率不佳,而助手或能过滤信息、缩短决策链路。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。