「评测环境」共找到 1070 篇相关文章
AI 创业,需要重读 Paul Graham 的「创业 13 条」
2009年YC创始人Paul Graham发表《Startups in 13 Sentences》,虽时间久远但核心观点不过时。创业者Chris Saad、Yaniv Bernstein结合经验和当下环境,剖析这13条创业原则,涵盖选联合创始人、快速发布产品等内容。
【手把手教程】不写一行代码,开发鸿蒙应用,赚华为1万!
作者实测不写代码开发鸿蒙应用流程,介绍华为鸿蒙激励政策,含三档奖励最高1万。还讲搭建DevEco Studio与AI编程环境,用Claude Code开发,以及构建、打包、上架应用步骤和实用技巧。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
自我进化Agent综述:通往超级智能的进化之路
当前大型语言模型面对新知识、动态环境时存在固定参数瓶颈,自进化智能体研究应运而生。本论文作为该领域首部系统性综述,提出革命性框架,解析自进化智能体技术脉络与未来挑战。
强化学习的两个「大坑」,终于被两篇ICLR论文给解决了
现有强化学习算法基于理想化交互模式,难应对真实环境。Mila 实验室两篇 ICLR 2025 论文提出实时强化学习框架,分别解决推理延迟和动作缺失问题,还可结合使用,对关键领域意义重大。
豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜
豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
优步针对微服务和大规模计算工作负载完成了大规模的 Kubernetes 迁移
优步成功将计算平台从 Apache Mesos 迁至 Kubernetes,覆盖多数据中心和云环境。工程团队详述迁移挑战、方案与教训。虽遇技术、文化难题,但迁移后运营效率等提升,为大公司提供借鉴。
一个跑智能体,一个专门找漏洞:Google发布Gemini 3.8双版本
9月2日,Google发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。前者用于编程等,已稳定上线;后者专用于发现修复漏洞,仅向特定方开放。二者共享基础能力,采用不同安全限制和部署环境。
金属探伤微小缺陷:YOLOv11 改进,漏检率从 54% 降低到 19%
工厂质检工作累且易出错,用摄像头加AI检测,需模型在复杂车间环境识别微小缺陷。论文对YOLOv11改进,插入三个即插即用模块,降低漏检率、提升精度,还做了公平实验,公开数据。