「知识评估」共找到 1171 篇相关文章
Nature 正刊收录!清华 FIB 实验室揭示:AI 提升科学家个人影响力,却收缩科学整体探索空间
清华大学 FIB 实验室牵头研究表明,AI 在自然科学应用广泛,提升科学家个人影响力,但使科学整体探索空间收缩。研究基于大量论文和人员数据,还提出科研智能体系统 OmniScientist 缓解问题。
太强了!这个 NotebookLM Skill,真的把 NotebookLM 搬进了命令行!
Google的NotebookLM凭借强大模型能力成AI圈“现象级”产品,如今开发者将其搬到命令行,开源神器notebooklm - py诞生,具备AI Agent工具、研究自动化等功能,有多种使用方式。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
港科大教授实测AI眼镜“作弊”:30分钟碾压95%的学生,把传统教学评估体系整破防了
香港科技大学教授团队让搭载ChatGPT - 5.2的乐奇AI眼镜参加《计算机网络原理》期末考,30分钟得92.5分超95%学生。此测试暴露AI眼镜功耗和清晰度问题,也引发对传统教学评估体系的反思。
「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库
2025年国内AI产品领域涌现众多关键词与颠覆性产品。为把握市场动向,量子位智库2025年度「AI 100」榜单开启招募,分三大板块评选,采用双重评估体系,含多周边内容。
这个框架让大模型省下50%内存,合并专家不如直接删掉?
Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。
大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南
Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。
Nature新研究:AI竟然分不清事实和信念
斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。
华为Doc-Researcher 布局感知+视觉语义双杀
现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。
大模型“精细化”对齐,真实性提升25.8%刷新SOTA!token级精准编辑,无需训练即插即用
北航团队在EMNLP 2025提出Token - Aware Editing (TAE)方法,从token层面解决传统表征编辑技术问题,无需训练、即插即用,在多个对齐维度显著提升,如在TruthfulQA任务上真实性指标提升25.8%。