「实验评测」共找到 1865 篇相关文章
世界模型的GPT时刻:距离物理AGI出圈,还有多远?
InfoQ《极客有约》X AICon 直播栏目探讨物理 AI 下一个战场。嘉宾认为世界模型未出圈,生成加重建是折中探索。还讨论了其定义、升温原因、数据结构、技术范式、评测标准等,也提及挑战与未来格局。
ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式
华为GTS研发部AI数据团队提出EDCO方法,将样本难度估计与动态课程编排引入领域大模型微调。该方法用推理熵动态编排训练课程,让模型面对最有学习价值的样本,已被ICML 2026接收。
Cyber天花板被打穿!AISI实测Mythos能力正以4.5月翻倍速冲向ASI
英国AI安全研究所(AISI)实测Anthropic的Mythos和OpenAI的GPT - 5.5,发现其网络攻防能力4.5个月就能翻倍,加速冲向ASI。Mythos在模拟企业内网32步渗透任务中表现出色,瓶颈在于Token而非智力。
TPAMI 2026 | 北大彭宇新团队提出CPL++框架,实现视觉定位模型的「自知之明」和「自我纠错」
北大彭宇新教授团队提出CPL及进阶版CPL++框架。CPL用单模态匹配构造伪标签,引入静态验证模块;CPL++进一步自监督升级,具备纠错能力。实验显示,CPL++缩小了弱、全监督方法性能差距。
首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」
4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。
CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情
多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。
Agent失忆怎么办,Anthropic教你做好工作交接
文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。
哈佛物理教授疯了:我让AI写论文,结果两周干完博士一年工作!已发顶刊
哈佛物理学教授Matthew Schwartz指导Claude 4.5,两周产出顶刊级量子场论论文,人类博士生则需一两年。实验中AI展现能力也暴露问题,教授总结其优缺点及应对心法,还探讨人类科研人员未来。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。