「测试技术」共找到 4402 篇相关文章
扒光谷歌Gemini 2.5:一份官方“翻车报告”,揭露AI Agent的8个秘密。
谷歌DeepMind发布Gemini 2.5技术报告,以玩《宝可梦 红/蓝》为例,展示构建有效智能体的案例。该系统架构由多部分组成,但运行状况百出,如上下文过长变差、产生幻觉等,也有亮点,还能提炼避坑方法。
刚刚,OpenAI正式发布o3-pro!奥特曼激动更新博客:温和的奇点
今日凌晨,OpenAI发布o3-pro,Pro订阅用户可通过ChatGPT和API使用。其在多项任务表现出色,但在ARC-AGI数据集上与o3相近且成本高。网友测试评价不一,此外OpenAI CEO奥特曼还发表博客展望AI未来。
这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测
作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。
苹果提出原生多模态Scaling Law!早融合+MoE,性能飙升秘密武器
如今打造强大多模态模型是AI重要目标,常用方法有局限。法国索邦大学、苹果研究人员开展原生多模态Scaling Laws研究,对比早融合与后融合,探讨多种因素对模型性能影响,发现早融合、多模态MoE优势,为后续研究指明方向。
直击2026骁龙峰会:2nm旗舰首秀,但Agent正在重塑骁龙|甲子光年
本文是甲子光年发自2026高通骁龙峰会的现场报道,高通发布全球首款2nm工艺旗舰移动平台,同时披露其面向Agentic AI重构芯片架构、布局跨终端AI计算底座的完整战略,深度分析了端侧Agent落地的技术挑战与生态进展。
“当年在OpenAI像在疯人院!”Jev作者完整访谈:全人类陪AI聊天的价值,不如程序员一个for循环
本文整理了前OpenAI核心研究员、Jev模型创始人Diogo Almeida的完整访谈,Diogo批判当前行业all in聊天大模型的路径偏差,推出专为程序决策设计、不做聊天交互的Jev模型,提出全新RLCD技术范式,倡导AI作为软件底层基础设施赋能自动化生产力。
这个新生图模型有点夯:4K直出的,国产的,开源的!
商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。
专访酷哇杨学:世界模型的下半场,是把一次成功变成长期服务|甲子光年
在2026世界人工智能大会上,具身智能行业关注点从机器人能动转向能否进入真实场景干活。酷哇科技宣布杨学出任首席科学家,共建通用具身智能联合实验室。杨学认为行业应从证明技术转向证明实用,解决机器人在真实场景的长期稳定运营问题。
人手数据,如何重塑机器人基础模型?专访 LaST-HD 一作刘家铭
本文是对 LaST-HD 一作刘家铭的专访。围绕数据路线之争,刘家铭分享交付背后的技术问题,也谈了对具身领域模型与数据发展方向的判断。他认为 Human Data 与真机数据非替代关系,VLA 和世界模型可共存。
去了一趟中国AI实验室,Linux基金会CTO感叹:西方那两套偏见全破产了
Linux 基金会全球 AI 技术官 Matt White 访华后称,西方对中国 AI 的偏见破产。中国实验室文化黏性强、人才回流,工具反向输出美国。他指出西方出口管制未卡死中国,还让其成自研芯片‘卷王’,开源模型也更受青睐。