评估机制」共找到 1533 篇相关文章

新闻资讯8

Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光

2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。

InfoQ
新闻资讯7

港科大教授实测AI眼镜“作弊”:30分钟碾压95%的学生,把传统教学评估体系整破防了

香港科技大学教授团队让搭载ChatGPT - 5.2的乐奇AI眼镜参加《计算机网络原理》期末考,30分钟得92.5分超95%学生。此测试暴露AI眼镜功耗和清晰度问题,也引发对传统教学评估体系的反思。

量子位
新闻资讯7

「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库

2025年国内AI产品领域涌现众多关键词与颠覆性产品。为把握市场动向,量子位智库2025年度「AI 100」榜单开启招募,分三大板块评选,采用双重评估体系,含多周边内容。

量子位
算法论文8

综述解读:Memory in the Age of AI Agents

文章围绕《Memory in the Age of AI Agents》展开,指出传统方案难解决Agent长期智能问题,Agent Memory是关键。介绍其形式、功能、动态机制,分析挑战并预测未来方向,为设计记忆系统提供指南。

CourseAI
新闻资讯7

ICLR 2026还会好吗?300篇投稿50篇含幻觉,引用example.com竟也能过审

GPTZero扫描300篇ICLR 2026投稿论文,发现50篇含引用幻觉,如用example.com作引用,且经同行评审也未识别。学术会议和期刊在AI重压下不堪重负,GPTZero幻觉检测工具或助同行评审。

机器之心
开源动态7

这个框架让大模型省下50%内存,合并专家不如直接删掉?

Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。

AI工程化
开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
新闻资讯7

夸克做ChatBot,为什么是现在?

AI行业曾有“垂直Agent幻觉”误区,重演App时代“功能碎片化”老路。而模型趋势是泛化与整合。10月23日夸克上线“对话助手”,其此时入局是基于技术、竞争和交互形态三重判断,且有模型和系统双重保障。

乱翻书
算法论文8

景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板

上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。

机器之心
新闻资讯8

250份文档投毒,一举攻陷万亿LLM!Anthropic新作紧急预警

Anthropic最新研究揭示,仅250篇恶意网页就能让大模型“中毒”,遇特定触发词会崩溃。研究还设计DoS型后门攻击,验证不同规模模型攻击效果。同时指出AI开放性易被操控,而Anthropic注重安全,有“防爆层思维”。

新智元