「自给率」共找到 299 篇相关文章
深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题
OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。
真·博士水平!GPT-5首次给出第四矩定理显式收敛率,数学教授只点拨了一下
在数学教授引导下,GPT - 5首次将定性的第四矩定理扩展为带有显式收敛率的定量形式,明确了收敛速率。研究人员还引导其将结果推广到泊松情形,作者起初想将其列为论文共同作者但被 arXiv 政策禁止。
AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品
ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。
a16z 提出 AI 产品的「水晶鞋效应」:第一批用户反而是最忠诚的
OpenRouter 报告基于 300 多个模型、100 万亿个 token 交互数据,分析 LLM 应用情况。提出「灰姑娘水晶鞋效应」,即 AI 模型首批用户留存率更高,与传统 SaaS 玩法相悖,还通过案例分析其表现及对 AI 创业的影响。
为什么我坚决投入GEO(生成式引擎优化)?
AI改变流量分配规则,站长竞争焦点从‘排名位置’变为‘被引用率’,GEO应运而生。作者总结了GEO打法,如优化全站、关键页面,做结构化数据增强,还应用于自身产品。
Claude Code auto mode 解析:如何用 AI 分类器替代人工审批
Anthropic 发布 Claude Code 的 auto mode 解决审批疲劳问题,用 AI 分类器替代人工审批。介绍了其核心思路、判断危险的标准、两阶段分类等,还分析了漏检率、被拦截后的处理及子 Agent 检查等,也指出了目前局限。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。
ICCV 2025放榜!录取率24%,夏威夷门票你抢到了吗?
ICCV 2025 于 10 月 19 - 25 日在美国夏威夷举行,已公布论文接收结果,录用率 24%。投稿量近 2019 年三倍,录用率较稳定。会议实施新政策,部分论文因审稿人问题被拒引争议。还提及投稿量激增挑战及评审系统改革建议。
算法1年翻倍,芯片2年翻倍?重磅实锤:AI正在自我加速,拦不住了
NBER论文证明AI研发自我加速反馈环强度远超其他科技领域,芯片效率每2年、算法效率每1年翻倍。部分自动化就能引爆反馈环,全行业13%自动化率或软硬件17%自动化率可触发奇点,6年内AI可能实现自我迭代。