「事实保真度验证」共找到 874 篇相关文章
我在哪?要去哪?要怎么去?字节跳动提出Astra双模型架构助力机器人自由导航
当今机器人导航系统在复杂室内环境面临挑战,字节跳动研发创新双模型架构Astra,含Astra - Global与Astra - Local子模型。经实验验证其性能佳,未来有广阔应用前景,但也存在需改进之处。
等了十年,特斯拉Robotaxi终于上线!马斯克:仅需4.2美元一口价
上周日,特斯拉在德克萨斯州奥斯汀启动Robotaxi服务,首批乘客4.2美元一口价。服务限定试运营,覆盖区域受限,车内有安全监控员。目前体验平稳但不成熟,未来能否后发先至待验证。
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。
LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?
论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。
奖励是假的,能让Qwen提升25%性能却是真的!
华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
OpenAI发布GPT‑6 Astra:百万级上下文,主攻编程和复杂办公
9月3日,OpenAI发布GPT - 6 Astra,重点提升电脑操作、软件开发和复杂工作处理能力。它有诸多更新,如电脑操作提速、支持异步工具调用等,但也存在监测难、价格高的问题,实际效果待验证。
从1000通到1.5万通,百融智能的「硅基客服」真正开始「上岗」
今年7月,一家头部物流企业和大型综合类头部券商上线百融智能的AI客服,业务量和部署规模增长显著。百融智能正战略升级,以新一代AICC智能联络技术向多行业拓展,其创始人张韶峰分享了相关思考与技术优势。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
Karpathy头疼的“AI游戏困境”,被这款15分钟出包的国产神器破解了
8月初Andrej Karpathy指出通用AI做游戏时,LLM无法高效审查工作的弱点。而国产平台Spellcaster能先解析自然语言确定游戏设计,15分钟出包,还内置测试员验证,团队想工程化落地新方向。