「AI模型测试」共找到 13965 篇相关文章
AI 终于看懂了 ?5.4K Star Lieflat Charts~~~~
本文介绍获得5.4K Star的开源AI图表工具Lieflat Charts,该工具将图表选择、设计规范、真实性校验等环节融入Agent工作流,解决AI生成图表不符合阅读需求的痛点,明确了适用场景。
高盛研报:AI时代最大瓶颈不在算法和数据,而在电力和资本
高盛《Powering the AI Era》报告指出,AI是基础设施革命,其最大瓶颈是电力和资本。如一座250MW数据中心成本达120亿美元,2030年全球数据中心电力需求将激增,还介绍了应对办法及相关细节。
模型遗忘不代表记忆抹除!首次系统发现「可逆性遗忘」背后规律
研究人员发现大语言模型遗忘并非简单信息删除,可能藏于内部。他们构建表示空间诊断工具,区分可逆与不可逆遗忘,揭示真正遗忘是结构抹除。还在多种方法、数据集和模型上实证,得出系列结论。
全国首部AI智能体应用评估标准,现公开征集起草单位和个人!
2025年是AI智能体元年,市场规模将达113亿美元,但企业部署面临‘效能黑箱’,缺乏评估规范。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,现征集起草单位和个人。
腾讯大模型动作慢了吗?姚顺雨带着Hy3 preview杀进第一梯队
国内大模型发展迅速,腾讯此前动作较慢。姚顺雨加入后推动变革,混元团队重建推出Hy3 preview,有295B总参数和快慢思考融合架构,开源且性能优,在多方面表现出色,成本下降。
Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本
Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。
Nature | 清华&芝大团队:AI让个体科学家“加速”,却让科学边界“收缩”
2026年1月14日,清华与芝大团队在《Nature》发表研究,通过分析4100余万篇论文,揭示AI融入科研的“双重效应”:它是个人科研“加速器”,让使用者产出和职业发展提升;也是科学整体“收缩器”,使集体知识疆域收窄。
两次拿到陆奇投资,张浩然这次想用 Agencize AI 干掉所有工作流 Agent
Agencize AI 创始人张浩然认为,所有要求用户预先构建工作流的 Agent 都是错的。该产品让用户只需描述意图,就能完成自动化工作,为用户生成个性化软件,连接传统 SaaS 软件。其还谈到未来软件变革及产品壁垒等。
维纳智能登上Nature通讯:AI不只会回答问题,开始生成高精度行业数据
维纳智能登上Nature通讯,其让大模型自动生成高精度推理数据,用闭环反馈驱动专业Agent自主演化。该公司在多领域交出工业级精度答卷,还解决了Agent泛滥的困局,推出多款创新产品。
Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了
7 月,TML 发布 Inkling 模型,Mind Lab 发布 Macaron V1,二者均针对持续学习场景。持续学习走「参数空间的迭代」路线,让模型用得越多越好用。硅谷已有不少新尝试,产业链正在形成。