「OpenAI MLE - Bench」共找到 1988 篇相关文章
使用 GPT-5 进行编程的六个技巧
OpenAI给出使用GPT - 5编程的6个提示技巧,如指令准确无冲突、选对推理力度、用类XML语法结构化规则等,还提供了详细提示技巧的参考链接。
GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘
OpenAI工程师在GitHub仓库意外泄露GPT - 5.4,相关信息流传后被撤回。据传下周上线,其有200万Tokens上下文窗口与持久记忆,支持全分辨率视觉直读,将引发硬件内存之战。
Anthropic求锤得锤!Mythos 2被曝雪藏,Mythos 3正秘密研发
SemiAnalysis内部播客爆料,Anthropic新模型Mythos 2训练完成却被雪藏,正用其生成数据研发Mythos 3。Anthropic曾呼吁监管,如今自食其果。此外,OpenAI的Astra也因安全问题暂停部分活动。
Codex龙虾化!推出手机远程控制,与Claude Code竞争白热化
OpenAI的Codex可手机远程控制,与Claude Code竞争白热化。它跨设备无缝同步,支撑体验的是安全中继层技术。个人开发者体验提升,企业级环境诉求也得到回应,还推出针对性扩展工具。
我也入选了 Codex for Open Source
作者以SGLang Core Developer身份申请OpenAI的Codex for Open Source计划,本不抱希望,却收到入选通知,可免费使用6个月Codex Pro计划,认为积极参与开源是对的,Codex会加快开源框架迭代。
17000 tokens的GPT-5系统提示词被意外泄露,以及八点总结~
OpenAI GPT - 5的system prompt被曝光在github,约17803 Tokens、78960 Characters。文章对提示词做八点分析总结,如互动风格、写作要求、工具使用等,还给出工具部分重点。
北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!
北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。
GPT-5都救不了的AI幻觉,原来问题不在模型,在“考卷”
OpenAI研究指出AI产生幻觉的根本原因是评估和激励机制有问题。现有训练和评估流程奖励‘猜测’,导致模型易产生幻觉。研究还给出解决方案,要更新‘考试规则’,让模型适当表达不确定。
LLM长文本内卷,谁是真英雄?告别跑分玄学,我们需要一把“公道秤”
OpenNLG Group做了统一长上下文评估框架LOOM - Scope,兼容主流benchmark、model和长上下文加速方法。该框架围绕BENCHMARK、DEPLOYMENT和EVALUATOR三大核心模块,还提出LOOM - Bench应对评估成本制约。
ChatGPT默认模型大升级,GPT-5.5 Instant正式上线:新增记忆来源功能
OpenAI宣布ChatGPT默认模型升级为GPT-5.5 Instant,面向所有用户开放。升级核心是准确性,在高风险领域幻觉内容减少,能力全面提升,回复更简洁。还提升了个性化能力,引入记忆来源功能。