「系统评估」共找到 2283 篇相关文章
谷歌发76页智能体白皮书!你的「AI替身」已上线
谷歌发布76页AI智能体白皮书,剖析其应用前景。涵盖智能体运维、评估方法,探讨多智能体架构,还介绍智能体增强检索生成及企业应用,如NotebookLM企业版、Agentspace空间企业版等。
刚刚,Claude最新功能泄露!主动助手Orbit接管一切工作
2026年5月4日,testingcatalog挖出Claude隐藏功能Orbit,大概率会在5月6日Code with Claude大会发布。Orbit是主动式简报+洞察系统,跨Claude和Claude Code平台,能自动生成多工具简报,改变产品形态。
The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。
北大开源统一世界模型框架:多类合成推理任务一套搞定
世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。
MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩
2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。
Andrej Karpathy:一场里氏 9 级的大地震正在重塑整个编程行业
文章围绕AI在编程领域的应用展开,作者与大师交流AI Coding方式,后提及Andrej Karpathy观点,指出编程行业正被重构,程序员需掌握新抽象层,应对不稳定智能系统。
AI 的本质不是算力,而是「上下文革命」
上交大刘鹏飞团队提出人工智能本质是“上下文革命”,在论文中把“上下文”提升为智能系统核心结构,提出“上下文工程”学科框架,通过实验揭示智能发展规律,为AI发展指明新方向。
网络基础设施如何支撑大模型应用?北京大学刘古月课题组5大方向研究,相关论文入选ACM SIGCOMM 2025
在智能计算和网络演进背景下,北大刘古月课题组聚焦网络研究。其 5 篇论文入选 ACM SIGCOMM 2025,从架构、数据、运维、安全四个维度形成技术闭环,推动新一代网络系统发展。
一篇自进化Agents技术最新综述:迈向人工超级智能
LLMs有局限性,研究者关注自进化Agents系统,其范式转变为人工超级智能铺路。文章回顾自进化智能体研究进展,围绕‘什么要进化’‘何时进化’‘如何进化’展开,提供理论和实践指导。
开源RAG又添新军!港大开源多模态RAG神器,多文档格式统一解析、知识图谱索引与混合检索!
在AI信息检索领域,传统RAG系统难处理复杂文档。港大数据智能实验室开源RAG - Anything,可提供端到端解决方案,能多格式解析、构建知识图谱和混合检索,优势显著。