系统评估」共找到 2297 篇相关文章

算法论文7

AI版盗梦空间?Claude竟能察觉到自己被注入概念了

Anthropic最新研究发现LLM有内省迹象,Claude能察觉概念注入。研究用概念注入测试,虽模型内省能力有限且不可靠,但能力强的Claude Opus 4和4.1表现好,未来内省或更复杂。

机器之心
算法论文8

一个指令误导智能模型!北航等首创3D语义攻击框架,成功率暴涨119%

北京航空航天大学与中关村实验室团队提出全新框架InSUR,入选NeurIPS 2025。该框架可基于指令生成对抗样本,首次实现3D SemanticAE生成,从采样、建模、评估三方面突破,实验验证其有效性与可扩展性。

量子位
开源动态8

AI牛马实现“干中学”!上海AI Lab联合推出智能体自我进化新框架

上海人工智能实验室等研究者提出MUSE智能体框架,让智能体实现“干中学”。它围绕分层记忆模块,通过先做、再反思、然后进化,解决现有智能体痛点,实验表现出色,还展望了未来优化方向。

量子位
新闻资讯8

2025乌镇峰会看点:人工智能,中国数字世界秩序之巅

2025年世界互联网大会乌镇峰会是战略转折点,议程、展览等聚焦AI,从宽泛论坛变为展示AI驱动发展模式平台。报告剖析议程架构、战略差异,评估其对全球AI格局等多方面的影响。

AI Reading Hub
开源动态8

蚂蚁dInfer框架,让扩散大语言模型推理速度再飙10倍,相同模型性能下超越自回归模型

蚂蚁开源dInfer框架,联合名校发论文阐述实现细节。它解决扩散模型推理难题,提出创新算法和系统优化策略,实验显示其推理速度远超Fast - dLLM和自回归模型标杆vLLM,代码已开源。

AIGC开放社区
新闻资讯8

OpenAI最新开发者“全家桶”:Apps SDK、Agent Builder、ChatKit深度解读与实测

长假期间,OpenAI在2025 DevDay宣布开发者生态重大升级,引入“Apps in ChatGPT”及其SDK和AgentKit工具集。文章深度解读Apps SDK、Agent Builder、ChatKit,介绍功能、使用方法和体验,还提及OpenAI的AI大平台战略。

AI大模型应用实践
新闻资讯7

微软公开预览可充当 MCP 服务器的 Logic Apps

微软宣布 Azure Logic Apps(标准版)公开预览新功能,可充当 MCP 服务器,为开发者构建和管理代理提供灵活方式。MCP 是开放标准,让 LLM、AI 代理等与外部系统交互,此功能好处多。

InfoQ
推荐文章8

陶哲轩长文剖析现代社会:大型组织挤压小型社群,个体陷入疏离困境,AI正在加速这一进程

陶哲轩长文以协作式数学项目社群现象为切入点,提出观察现代社会的框架。指出现代技术和激励体系在赋能个体与大型组织时,严重削弱小型组织,导致个体精神上出现脱节感,AI还在加剧这一问题,并给出新兴草根组织视角。

AI寒武纪
算法论文8

苹果传统强项再发力,视觉领域三种模态终于统一

苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。

机器之心
新闻资讯7

和知乎一起,推出了个 AI 先行者榜单

知乎发起AI先行者榜单评选,与作者合作。提名公开透明,来自社区征集。评选从多维度评估,综合各方评分推出首期榜单。活动非一次性,后续每季度都有,鼓励更多人参与。

特工宇宙