误报率」共找到 567 篇相关文章

新闻资讯7

AI 写代码太快,人类测试跟不上了,Meta 用新方法把 bug 检出提升 4 倍

Meta 用即时(JiT)测试方法提升软件质量,该方法在代码评审期间动态生成测试,在 AI 辅助开发环境中将缺陷检测能力提升约 4 倍,源于代理式工作流兴起及传统测试套件的局限。

AI前线
新闻资讯8

阿里权力交接全解读:9人出局、蒋凡上位、3800亿豪赌AI—投资者必读深度研

过去两年,阿里经历权力重组,合伙人缩减,蒋凡上位,吴泳铭押注3800亿AI。从“分封制”回归“集权制”、从运营驱动转向AI驱动,本文拆解变革,给出投资判断,分析各业务板块营收、竞争力,推演未来情景并提示风险。

AI Reading Hub
新闻资讯7

入人均10个顶级offer的技术天团活动,顶尖AI人才的选择逻辑我悟了

作者参加京东TGT计划活动,与两位入职京东的顶尖AI人才交流。Daniel因京东重视生成式推荐项目、技术氛围纯粹而选择它;Kyrie则被创业热情、技术理想共鸣及数据优势吸引。入职后两人都获核心项目机会。

量子位
推荐文章7

Google Cloud 最新 AI 创业者告:应用公司不用做自己的模型,速度和认知才是壁垒

Google Cloud 发布面向 AI 创业者的趋势告,邀请众多创业者和投资人谈 AI 趋势等内容。给出创业者建议,如动作要快、深耕细分领域等,还探讨平台级应用机会、AI 应用壁垒、增长方法、出海素质及投资人看好的赛道。

Founder Park
新闻资讯8

全球首份大模型业绩!MiniMax预判2026三大超级PMF,AI平台公司启程了

港交所上市52天,MiniMax交出IPO后首份年,2026年2月ARR突破1.5亿美元,2025年营收同比增158.9%,毛利飙升437%、亏损收窄。它产品密集迭代,还预判2026年有三个超级PMF,欲成AI平台型公司。

量子位
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过仅12%?

小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ
算法论文8

Test Time Scaling Law远未达到上限! o4-mini仅15.8%通过,华为诺亚提出代码HLCE终极基准

华为诺亚研究员推出全新编程基准HLCE,含235道竞赛难题。实验显示,顶级LLM在该基准表现不佳,推理模型优势大,IOI交互式题难攻克。研究还发现模型自我认知与推理能力发展不同步,Test Time Scaling Law远未达上限。

机器之心
推荐文章8

2025具身智能创投全景:554亿热钱,4大估值梯队,10亿元现金流门槛|量子位智库

2025年具身智能赛道迎来资本狂欢,投资事件从173起涨至447起,资金从137亿飙升至554亿。政策、产业链等因素致融资金额陡增,财务、产业、国资三股资本重塑格局,还形成估值四梯队。

量子位
算法论文8

人形机器人控制新突破!敏捷稳定两不,一个策略让人形机器人完成叶问蹲和跳舞|港大&英伟达&清华

港大、NVIDIA和清华联合团队提出AMS统一人形机器人全身控制框架,首次在单一策略实现动态运动跟踪和极限平衡控制。通过异构数据源、混合奖励机制和自适应学习策略,解决数据限制和优化目标冲突问题。

量子位
产品应用8

3D生成到达3.0阶段,不止提升行业渗透,也正催生3D原生新玩法 | 对话3D生成平台Tripo

AI 3D生成领域前景广阔但也有疑惑焦虑。量子位智库对话VAST创企,其创始人与CTO分享3D原生玩法、落地场景,还谈产品开发、需求发掘等认知,Tripo平台已覆盖众多用户。

量子位