学术评估」共找到 854 篇相关文章

算法论文8

一篇400+文献最新RAG技术系统性综述

本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。

PaperAgent
算法论文8

颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。

新智元
开源动态8

我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准

在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。

机器之心
产品应用8

上海一群青年,造了个学术版OpenClaw

上海科学智能研究院联合复旦大学发布超级科研合伙人“大圣”,它是面向科学探索的高能动性智能体。能在生命、地球、人文等多领域发挥作用,其研发涉及多模态模型、群体记忆架构等核心技术,还介绍了相关赛事。

量子位
算法论文8

从Demo到行业落地的Agents:技术、应用与评估

通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。

PaperAgent
算法论文7

新研究重新评估 AGENTS.md 文件在 AI 编码中的价值

苏黎世联邦理工学院新论文指出,`AGENTS.md` 文件可能常阻碍 AI 编码智能体。研究构建 AGENTbench 数据集测试,发现 LLM 生成文件降低性能,人类编写文件有边际收益但也增加成本,开发人员对此研究看法不一。

InfoQ
新闻资讯7

刚刚,NLP先驱、斯坦福教授Manning学术休假,加盟风投公司任合伙人

NLP领域先驱、斯坦福教授克里斯托弗・曼宁从斯坦福休假,加入AIX Ventures任普通合伙人。他是将深度学习用于NLP的早期领军者,著作、课程影响大,此次转型将助力AI初创公司发展。

机器之心
新闻资讯7

IJCAI 2026每篇投稿收100美元,学术圈却评价颇高

当下AI学术会议投稿评审体系受大模型冲击,投稿和低质量评审激增。IJCAI 2026将采取新投稿模式,每篇投稿收100美元,主论文豁免,费用支持审稿人,学者对此多持积极态度。

机器之心
新闻资讯7

都是TOP人才!跑遍全球,和机器之心共聚AI学术顶会

2025年AI加速发展,技术迭代快。机器之心围绕多场AI学术会议,在8座城市开展11场活动,有论文分享会和人才Meetup。2026年规划新活动,邀各方伙伴加入。

机器之心
算法论文8

颠覆搜索引擎,下一代Agentic Deep Research!12家顶尖学术机构联手提出

在信息获取方式变革背景下,12家顶尖机构联合发布论文提出Agentic Deep Research,它由大模型驱动,可自动规划检索路径等,或颠覆传统搜索范式,且有基准成绩和TTS Law支撑,开源生态也在聚焦。

新智元