「测试时间扩展」共找到 2429 篇相关文章
马斯克周末血裁xAI 500人
上周四晚,xAI内部突袭测试,淘汰率达33%,超500人被裁。此前其数据标注团队规模持续增长,多为直聘。此次战略转变,将扩专业标注员规模,或押注垂直行业AI。
GPT-5 之后,我们离 AGI 更近了,还是更远了?
2025年8月8日OpenAI发布GPT-5,架构有革新,在基准测试成绩优异,但跑分现场PPT出错、被Grok 4击败。它在编程表现出色、价格有竞争力,写作能力有争议,模型幻觉和提示注入攻击问题待解。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
开启 AI 自主进化时代,普林斯顿Alita颠覆传统通用智能体,GAIA榜单引来终章
普林斯顿大学AI Lab推出通用智能体Alita,秉持「极简即是极致复杂」哲学,采用「最小化预定义」与「最大化自我进化」设计范式,可自主创造MCP工具,在GAIA基准测试中表现卓越,还能实现MCP复用。
微软正式开源UFO²,Windows桌面迈入「AgentOS 时代」
微软研究团队正式开源业内首个深度集成 Windows 操作系统的桌面智能体平台 UFO² AgentOS。它是 UFO 升级版,解决传统智能体问题,在多维度实现突破,经测试表现领先,代码和文档已开源。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
他为500强造出冠军「AI裁员机器」!然后,把自己裁掉了
Donald King在普华永道为500强客户打造AI智能体,刚获OpenAI黑客松比赛第一名,2小时后就被裁。他创业成立AI营销机构,称被裁是好事,还建议失业者扩展人际网络。
吴恩达来信:智能体并行运行以提升效率
吴恩达称并行智能体成扩展AI规模新方向。AI性能会随数据量、训练及推理计算量提升,但耗时久。随着LLM每个token价格下降,更多智能体工作流被并行化,且相关研究增多。
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
一晚上,用AI干了7个PPT,我发现了一个让PPT设计师失业的方法
作者一晚用AI做7个PPT,分享让PPT设计师失业的方法。介绍苹果风格PPT效果,阐述10分钟搞定专业PPT的核心步骤,还对比了传统与AI方式的时间成本,最后预告下期分享内容。