「指标驱动」共找到 874 篇相关文章
对「学习」的一切认知都错了
曾被认为不可能的超大模型如今成功驱动ChatGPT等,改变了对学习的理解。彩票假说解释其成功:大网络有中奖子网,能提供更多找简单解的机会,调和了经验与经典理论。
The Information:揭秘 OpenAI GPT-5 崎岖的研发之路
The Information揭秘OpenAI GPT - 5研发困境,今年OpenAI遇技术难题,o3等模型研发受阻,内部有分歧。不过GPT - 5在编程等方面有提升,虽难与早期飞跃相比,但改进仍有价值,公司还在开发‘通用验证器’。
年营收5.5亿美元、美国Top 3的约会应用创始人:AI虚拟陪伴是「垃圾应用」
Hinge CEO Justin McLeod在访谈中分享经验。他认为AI虚拟伴侣是「垃圾应用」,Hinge以促成真实约会为核心指标,用AI实现个性化匹配和有效指导,还介绍组织架构、决策原则等内容。
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
醒醒吧!CEO猛吹AI写95%代码,绩效考核却还在拼程序员手速?
本文是对 Superhuman 工程负责人 Loic Houssier 的深度访谈。他分享了 AI 时代团队管理、开发流程、绩效评估等方面的变化,指出 AI 虽提升效率,但在质量评估、人才适配等方面仍需探索,还强调观望 AI 发展会有职业风险。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。
OpenAI即将发布:开源模型和浏览器
OpenAI将发布AI驱动的网页浏览器挑战谷歌Chrome,或集成代理Operator实现智能网络体验。还准备下周四发布类似o3 mini的开源模型,不再是微软Azure独家。谷歌也可能很快发布Gemini 3。
超震撼发布!全球首款实时生成游戏引擎Mirage来了
Mirage是全球首个实时生成引擎,借助先进AI世界模型实现实时UGC玩法,支持多种游戏类型。与其他成果相比优势显著,由定制模型驱动,打破传统游戏边界,让玩家动态创造新体验。
全球首款AI原生UGC游戏引擎诞生!输入文字秒建GTA世界,试玩体验来了
全球首个由实时世界模型驱动的AI原生游戏引擎Mirage问世,玩家能实时构思、生成并体验游戏世界。虽当前体验有不足,但它有显著优势,支持多元游戏类型,基于前沿技术构建。
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。