「成果评估」共找到 1415 篇相关文章
AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品
蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。
太初元碁乔梁:AI算法已经跑到单芯片极限|MEET2026
在量子位MEET2026智能未来大会上,太初元碁乔梁表示,当下AI算力需求指数级增长,超智融合成行业共识。单颗芯片性能成瓶颈,太初元碁设计PC link实现芯片互联,还分享了HPC+AI在多领域的落地实践。
Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与全栈豪赌,更是找回了“老谷歌”那个味儿
截至2025年底,Gemini在桌面和移动端单次使用平均停留时长首超ChatGPT,下载量也快速追赶。谷歌将其嵌入自家生态策略见效,这与Gemini 3推出有关,还体现了全栈能力与早期谷歌文化回流。
Gemini 首次反超 ChatGPT,谷歌CEO劈柴哥复盘:不止是十年算力与全栈豪赌,更是找回了“老谷歌”那个味儿
截至2025年底,Gemini在桌面和移动网页端单次使用平均停留时长超ChatGPT,下载量也快速追赶。谷歌CEO Sundar Pichai称这是全栈投入成果,还提及早期谷歌文化回流,也谈到未来十年押注等内容。
硅谷10万大裁员真相:AI根本没想取代你,是老板想干掉你
美国科技公司正大规模裁员,10月裁员人数暴涨。出版业大亨认为AI或致全民失业或经济崩盘,Meta用AI辅助绩效评估。AI常成裁员借口,实则与盲目扩招、财务压力等有关,美国大学文凭也在贬值。
理解规范驱动开发:Kiro、spec-kit和Tessl
作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。
视觉生成的另一条路:Infinity 自回归架构的原理与实践
本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。
大模型在具身推理上「翻车」了?4496 道题全面揭示短板
美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT
Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。