「OpenAI MLE - Bench」共找到 1988 篇相关文章
Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题
OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。
她们估值840亿,刚发了第一个AI成果
估值超120亿美元的Thinking Machines发布首篇研究博客,由创始人、OpenAI前CTO Mira Murati宣发。研究聚焦克服大语言模型推理中的不确定性,探讨推理结果难复现的根源,还介绍解决办法并验证效果。
涌现之谜:AI如何像人一样思考与表达?
文章探讨AI如何像人一样思考与表达。早期自然语言处理受通用语法理论影响,但面对真实语言复杂性存在困难。人类经历第一次认知革命实现思维转变,AI也需足够大规模才能涌现复杂能力,“大”或是智能第一性原理。
模型、代码、数据全开源!轻松训练自己的垂类Agent!
Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。
200K上下文突破:AI编程新星Augment崛起
AI编程新星Augment以65.4%的SWE - bench评分登顶榜首,估值超128亿美元。它能理解海量代码上下文,支持多环境集成。但新式AI编程工具存在安全风险,如Agent Memory恶意攻击等,文中给出应对建议。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。
AI Coding新王登场!MiniMax M2.1拿下多语言编程SOTA
MiniMax发布旗舰级Coding & Agent模型M2.1,在Multi - SWE - bench榜单中以10B激活参数拿下49.4%成绩,超越竞品成SOTA。它解决模型‘偏科’问题,适配开发工具链,实测在多语言编程任务中表现出色。
登顶!快手发布开源编程模型,720亿参数,创下编程能力新纪录
快手发布开源编程模型KAT-Dev-72B-Exp,在SWE-Bench Verified测试中登顶开源代码模型,与闭源GPT - 5成绩相近。该模型基于自研框架,有架构创新,还集成多种软件工程能力,是构建编程智能体的有力工具。
1亿签约金抢AI大神?谷歌AI元老劝退全网:别再读博了!
AI人才大战升级,Meta砸1亿美元挖OpenAI员工。谷歌元老Jad Tarifi警告,此时读博蹭AI热潮已晚,建议钻研AI+生物等新兴领域或远离。他还认为读博像赌博,社交与同理心等技能比学位重要。