「GPT - 5.3 - Codex」共找到 3929 篇相关文章
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板
DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。
ICCV 2025万篇投稿破纪录,作者被逼全员审稿!网友痛批不如GPT
ICCV 2025论文投稿量达11152篇创纪录,评审结果公布后引热议。网友吐槽部分评审意见质量差,还有作者不满全员审稿制度。大会禁止用大模型评审,也暴露了同行评审流程的官僚问题。
马斯克曝光Grok 5!1.5万亿参数,偷师Cursor狂练编程
5月25日凌晨马斯克官宣,1.5万亿参数Grok V9-Medium训练完成,2 - 3周后发布。训练灌入大量Cursor编程数据,编程能力将大幅提升。此前v8 - small年底前开源,马斯克编程赛道布局全面摊牌。
爆火!几天狂揽5万星,这个神器让AI一次砍掉54%屎山代码
最近开源项目Ponytail爆火,几天揽5万星。它将老程序员‘偷懒智慧’系统化喂给AI,让AI编码代理思考,使代码量直降54%,最高砍到94%,成本和时间同步下降,还保持100%安全。
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
狂砸百亿美元后,仅5%企业成功落地AI,他们做对了什么?
企业在生成式AI领域投入数百亿美元,但95%的机构未获可衡量商业回报,此为「GenAI鸿沟」。原因包括工具缺乏学习能力、预算分配失衡等。少数成功企业聚焦高价值用例,选易部署工具,与供应商深度合作。
Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。
RPA要没了
Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令式,有诸多缺陷;Codex是目标式,是RPA替代品,还构建了企业自动化体系。
斯坦福7B智能体全面超越GPT-4o,推理流登顶HF
传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。