「问题生成」共找到 4986 篇相关文章
21
本文聚焦vllm v1中管控模型分布式推理的核心Executor部分,介绍其4种类型及适用场景,以mp类型为例阐述Executor - Workers架构,还说明了大小数据在两者间的传输机制及原理。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
AgentA/B:用AI模拟用户,真人AB测试或将成为历史
宾夕法尼亚州立大学和亚马逊合作研发AgentA/B测试框架,用大语言模型生成虚拟用户模拟真实行为,成本低、速度快,还能绕开真实流量测试。虽有人质疑,但它或改变传统AB测试。
当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据
本文针对Agent场景下AI幻觉会转化为实际错误操作的问题,介绍深圳大学与香港科技大学提出的ECA框架,通过独立验证加门控检查降低不安全执行风险,给出测试数据验证方案有效性。
终于用上啦,3.9 万 Star archify,程序员福音!!!!
架构图常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地图,它先结构化、验证再交付,适用于特定场景。
特斯拉为什么非要造Cybercab?|甲子光年
北京时间9月4日,特斯拉低调发布Cybercab,已进入奥斯汀Robotaxi运营体系。它专为Robotaxi打造,无方向盘与踏板。文章探讨特斯拉造它的原因,涉及成本、生产等,也指出业务面临财务和法规问题。
让代码接管世界演化,西湖大学发布Code视频世界模型
西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。
刚刚,OpenAI GPT-6 Astra震撼发布!AGI时代来了
OpenAI正式发布GPT - 6 Astra,总裁称已到AGI时代。该模型定位为“世界上最智能、最对齐的模型”,在多领域表现出色,能力强、速度快、成本低,还具备“关键级”网络安全能力,将逐步开放给用户。
5个月估值翻10倍,AI数据赛道跑出一家新独角兽
成立约18个月的AI训练数据公司AfterQuery正筹新一轮融资,估值达32亿美元,5个月涨超10倍。它最初想开发AI智能体,后转收集训练材料。此赛道已有多家高估值公司,且数据隐私和安全风险待解。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。