学术评估」共找到 854 篇相关文章

推荐文章8

大模型Agent的核心还是prompt? 目前有什么挑战?

文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。

深度学习自然语言处理
新闻资讯7

破防了!全球顶尖AI惨败,人类最后防线竟是「重启试试」?

GSMA联合权威组织发起全球电信AI故障排查挑战赛,吸引超1000支队伍。赛事依托权威评估框架,设丰厚奖励,分多个赛道,还将开展智能体任务,预示电信运营模式重构。

新智元
算法论文8

LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识

Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。

PaperAgent
新闻资讯7

一人作弊,全组「连坐」拒稿! ICML最狠新规,华人大佬挂帅严查

ICML程序主席发布同行评审新举措,包括打击“切香肠”式投稿、“连带直接拒稿”机制、审稿人互惠原则等,若有人论文作弊,全组投稿或被拒,2026年会议将由华人大佬挂帅。

新智元
新闻资讯7

突发!中国商务部已启动对Meta收购Manus的审查。

据英媒爆料,中国商务部启动对Meta约20亿美金收购AI初创公司Manus审查,重点评估其技术出口管制及地缘政治风险,审查处早期阶段,此事件给AI创业者释放监管信号。

开源AI项目落地
算法论文8

最火、最全的Agent记忆综述,NUS、人大、复旦、北大等联合出品

多所顶级学术机构联合发布百页综述《Memory in the Age of AI Agents: A Survey》,为‘Agent Memory’梳理技术路径。提出三角框架,辨析与其他概念差异,还探讨记忆形式、功能、运转机制,展望未来发展方向。

机器之心
开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
算法论文8

告别黑箱解释!首个潜变量自动解释框架 | CIKM'25

深度生成模型内部运作如「黑箱」,潜变量意义难捉摸。埃默里大学团队提出LatentExplainer框架,经数据扰动、智能提示、不确定性评估三步,为潜变量生成易懂解释,提升模型解释质量与可靠性。

新智元
新闻资讯7

教育工作者如何使用AI?Anthropic分析了7.4万份对话后,发现了这些

Anthropic分析7.4万份匿名对话,揭示高校教师用Claude的情况。教师用AI场景多样,如课程开发、学术研究等。使用方式分协作增强与完全委托,AI评分有争议,研究也存在局限。

AGI Hunt