「推理准确率」共找到 2257 篇相关文章
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
AI基础架构重大突破,计算成本暴降38倍
Perforated AI团队搞出‘穿孔反向传播’技术,给旧神经元加‘人工树突’。测试中计算成本最高降38倍,模型准确率不降反升,还近乎即插即用。这或引发行业变革,但也面临验证、生态和收费等挑战。
SGLang支持GPT-OSS:从Day 0支持到性能增强
SGLang宣布重大更新,聚焦openai/gpt - oss - 120b模型深度性能优化与新功能。预填充和解码阶段吞吐量显著提升,支持多GPU,有推测解码等功能,还支持智能体应用程序,且不损害模型推理能力。
刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大
网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。
OpenAI高管自爆:Scaling不死,GPT-5「双轴训练」撕开智能天花板
OpenAI首席运营官Brad Lightcap在对话中揭秘GPT-5,其能自主判断是否深度推理再作答,体验全面升级。训练方式有后训练,Scaling Law仍成立,未来从两轴改进。还探讨了AGI、应用场景等。
UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由
随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。
北大、字节跳动联手发布SWE-Swiss:一把修复代码Bug的「瑞士军刀」,完整配方直指开源SOTA
北大、字节跳动等联合研究提出SWE - Swiss配方,用于训练解决软件工程问题的AI模型。32B参数的SWE - Swiss - 32B在SWE - bench Verified上准确率达60.2%,各训练环节效果显著,模型和数据将开源。
扩散架构 or「NoThinking」,AI 对话的「1Hz 壁垒」如何突破?
当红通用人形机器人公司 1X 的 AI 副总裁 Eric Jang 提出「智能频谱」概念,阐述当前 AI 面临的「1Hz 壁垒」及实现「Ultra Instinct」能力的先决条件。不同推理方案有望解决部分问题,但通用智能体仍有瓶颈。
ART:构建可靠智能体的强化学习新框架
现有AI智能体在真实场景表现不稳定,阻碍其应用走向生产。ART开源强化学习框架诞生,通过分离“前端”与“后端”、兼容OpenAI推理端点等创新化解困境,还给出使用方法,在案例中展现强大效能与经济性。
刚刚,ARC-AGI-3发布!人类100分,最强AI零分
ARC Prize发布ARC - AGI - 3预览版,测试范式从静态谜题到交互式游戏。新引入交互式推理基准测试,人类轻松通关,最强AI却全军覆没。但测试引发社区质疑,奖金设置也遭吐槽,且存在体验和技术问题。