「AI测试集」共找到 10934 篇相关文章
宋晓冬、李博加入Meta,超级智能迎来最强“守门人”
近期AI安全受关注,Meta引入Virtue AI三位联合创始人及部分核心团队到超级智能实验室。宋晓冬、李博、桑米·科耶乔都是AI安全等领域知名学者,Virtue AI有安全防护与治理产品,Meta借此补强安全能力。
米哈游蔡浩宇,发了个“游戏版ChatGPT”
米哈游蔡浩宇上新AI聊天软件AnuNeko,用户反馈其人性化高但逻辑较弱。AnuNeko出自蔡浩宇新公司Anuttacon,该公司此前还推出实验性AI游戏。如今AI+游戏大势所趋,米哈游新游也加入更多AI元素。
24B模型编程超DeepSeek全家桶,32G内存苹果电脑就能跑,专门针对真实GitHub Issue训练
Mistral发布最新开源编程模型Devstral,参数24B,能在单卡RTX4090甚至32G内存Mac上运行。它专为编程智能体推出,针对真实GitHub Issue训练,在SWE - Bench Verified测试中表现出色,还可与All Hands AI框架配合。
上海外滩大会官方艺术展《纠缠,而后日以作夜》
本文介绍2026 Inclusion·外滩大会首届官方AI概念艺术展《纠缠,而后日以作夜》,是外滩大会创办以来首个AI艺术节板块,也是国内首个Agent导览的AI概念艺术展,梳理AI艺术发展脉络,探讨人机共生关系,呼吁保留人类决策能力。
奥特曼首次透露GPT-5上手体验:在擅长领域感到无力,往后一靠感到眩晕
OpenAI掌门人奥特曼在深度访谈中透露上手GPT - 5的体验,称在擅长领域感到无力、眩晕。他还抛出孩子不会比AI聪明、AI CEO或接管OpenAI等观点,探讨AI竞争及硬件适配问题。
把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱
作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。
比豆包手机还狠!Gemini电视登场CES,谷歌打响客厅革命第一枪
2026年CES上科技新品频出,谷歌将Gemini AI引入Google TV,让电视具备自然语言内容发现与推荐、教育深度学习等功能,还增强语音控制能力,打响客厅AI革命第一枪,同时涂鸦智能展示了AI生活助手等产品。
三点十四分的狗
文章指出AI记忆面临诸多困境,如记不住、记太多,还有记忆审计和沉淀判断力等问题。作者认为遗忘是记忆系统的重要功能,AI应学会主动遗忘,谁先解决此问题,谁就能做出真正懂人的AI。
o4-mini暴击六大数学天团,攻破陶哲轩难题!4.5h激战人类阵地失守
Epoch AI团队举办竞赛,约40位数学精英分成8组与o4 - mini - medium在FrontierMath基准上对决。o4 - mini击败6组团队,虽未完全超越人类,但Epoch AI预测到2025年底AI可能超30% - 50%人类基准。
全球爆红后,Clawdbot之父2小时深度专访:退休3年后我杀回江湖
新智元对Clawdbot之父Peter Steinberger进行近2小时专访。他分享AI编程工作流,如一天600个Commit、让AI验证代码、用多个Agent并行开发。他还讲述经历,认为AI时代程序员要关注系统架构,强调与AI融合。