「AI基准测试」共找到 10678 篇相关文章
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。
Anthropic联创定下deadline:2028年AI实现自我进化,没有人类了
Anthropic联合创始人Jack Clark认为,到2028年底,递归自我改进发生概率有60%,即AI或能自主构建和改进自己。他基于公开AI开发数据和基准测试得出此观点,不过也有人提出质疑。
AI Agent的未来之争:任务规划,该由人主导还是AI自主?——阿里云RDS AI助手的最佳实践
文章以阿里云RDS AI助手实践为例,探讨AI Agent任务规划该由人主导还是AI自主。实测发现大模型自主规划效果不佳,企业更需稳定可靠,人工规划是最佳选择,还提出用‘混合规划’兼顾灵活与可靠。
「All in AI」的 Shopify,分享了他们的全员 AI 落地实践,全是干货
Shopify 三个月前决定「All in AI」,副总裁 Thawar 分享公司引入 AI 的策略、提升效果与三个「反直觉」见解。如全员无差别用 AI、让 AI 展示思考过程、重视新手等,还给出多个工作流案例。
RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开
今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。
刚刚,国产AI自己造了AI,全球首例!
面壁智能实现全球首例国产AI造AI,用AI编写预训练框架ForgeTrain,性能超英伟达Megatron,还训练出MiniCPM5 - 1B模型。该模型可作桌宠,小尺寸高智能,还能自定义人格,提供工具链。
瓦卡奖AI视觉创意大赛·从人工智能专家跨文化对话到全球AI厂商的竞技
10月17 - 19日,第二届瓦卡奖AI视觉创意大赛在深圳举行。期间AI全球视觉工作坊汇聚专家探讨AI与艺术融合,竞技日集结全球AI视频厂商民间团队参赛。大赛还发布国内首部《AI视觉创意应用蓝皮书》。
State of AI 2025:霍桑效应下,AI 是「赚钱机器」还是「泡沫机器」?
Air Street Capital发布2025年度《State of AI Report》,证实AI成重要经济增长动力,但技术突进伴随矛盾。报告提及AI推理能力有‘霍桑效应’,或成泡沫,不过AI - first公司商业化加速,付费工具采用率和合同价值飙升。
AI教父Hinton首次现身中国,合照全网刷屏!预警AI觉醒临界点已至
AI教父Hinton首次现身中国,与市委书记合影刷屏。他多次预警AI危险,称其觉醒临界点已至。演讲深入探讨AI演变,解释工作方式,分析AI或比人类强及有主观体验的原因。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。