「图灵-AGI测试」共找到 2147 篇相关文章
AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板
MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。
从0到1:天猫AI测试用例生成的实践与突破
本文阐述天猫技术团队在AI赋能测试领域的实践,讲述智能测试用例生成落地路径。介绍业界现状与天猫业务特性,给出实施策略,展示应用效果,还指出问题并对未来发展做了展望。
Demis Hassabis:AGI 还缺什么,智能体到底行不行,下一个科学突破长什么样
Google DeepMind CEO Demis Hassabis 做客直播,探讨当前 AI 范式距 AGI 差距、智能体水平、科学突破模式等话题。指出当前范式或需关键突破,记忆方案待优化,AlphaGo 技术复活,还给出创业建议。
OpenAI 收购 A/B 测试新秀Statsig :印度裔创始人出任应用CTO,执掌 ChatGPT 产品工程
OpenAI宣布收购A/B测试巨头Statsig,其创始人Vijaye Raji将任应用部门CTO,负责ChatGPT等产品工程。Statsig为企业提供A/B测试等服务,收购将增强OpenAI实验能力。
辛顿高徒压轴,谷歌最新颠覆性论文:AGI不是神,只是「一家公司」!
2025年12月19日,谷歌DeepMind发布论文《分布式AGI安全》,提出AGI可能是“拼凑型”,由众多专才模型组成,在经济上更划算。还指出其存在风险,如默契合谋、责任消解等,并给出基于“防御纵深”原则的安全框架。
如何让AI帮你做前端自动化测试?我们这样落地了
本文介绍阿里基于AI的UI自动化测试框架在专有云质量保障的实践。框架用开源browser - use等工具,采用自然语言驱动用例、动态元素定位等机制,还应对了大模型幻觉等挑战,也提及构建企业级数据分析Agent方案。
Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本
Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。
Cloudflare 发布 Dynamic Workers 公开测试版:基于 Isolates 的沙箱环境执行 AI 智能体代码
Cloudflare 推出 Dynamic Worker 公开测试版,面向付费用户。它用 V8 Isolates 运行代码,启动快、内存效率高,基于 Code Mode 理念,用 TypeScript 接口定义 API,有多种防护策略,还发布配套库,已用于生产。
Meta华人新秀毕树超,重磅爆料下一代LLM路线!RL+预训练直通AGI
OpenAI前研究员、Meta成员毕树超在哥大演讲指出,AGI需高质数据、好奇驱动探索与高效算法,Scaling Law有效,规模决定智能,终身学习是重点,还探讨了AGI面临的诸多问题与挑战。
中国AGI深度时刻!杨强、唐杰、林俊旸、姚顺雨大咖们2026开年重磅交锋
2025年中国开源模型表现出色,AI大模型探索新范式。AGI - Next前沿峰会嘉宾探讨AGI发展,指出大模型To C与To B市场逻辑分化,还谈及自主进化、智能体变革及中国AI发展路径等问题。