「评估框架」共找到 2216 篇相关文章
Nature:博士太多,高校已经装不下了!
过去几十年全球博士毕业生数量爆炸式增长,远超学术界职位空缺。如今就业从学术界转向工业界,未来博士教育培养模式应转变,产学研结合,以匹配劳动力市场。
大模型全员0分!谢赛宁领衔华人团队,最新编程竞赛基准出炉,题目每日更新禁止刷题
谢赛宁等人出题,让o3、Gemini - 2.5 - pro等模型全军覆没。LiveCodeBench Pro是实时基准测试,题库每日更新。此前称LLM编程超人类专家,本次测试并非如此,最好模型难题通过率也为0。
智能体自己出现问题自己找!首次提出“自动化失败归因”课题 | ICML2025 Spotlight
LLM Multi - Agent系统失败诊断难,阻碍迭代优化。宾夕法尼亚州立大学等机构研究者首次提出“自动化失败归因”课题,构建Who&When数据集,开发评估多种归因方法,实验揭示当前方法不足。
谷歌AlphaEvolve引发OpenAI关注:AI原创算法,正挑战人类专家界限
谷歌DeepMind推出的AlphaEvolve系统,结合Gemini模型与进化算法,能自主探索、生成并迭代优化算法代码。它优化经典算法,在多领域取得突破,其原创能力引业界关注,OpenAI研究员对此表示震撼。
狂揽 9.9K star!比Selenium更好用的网页自动化利器,功能超强,太6了!
本文分享开源项目 SeleniumBase,它包装 Selenium 的 WebDriver API,功能强大。支持主流浏览器,内置测试框架,能搞定防爬检测。有智能等待等特色,安装简单,GitHub 有大量示例。
微软 SkillOpt:不动模型权重,只训练那份「技能说明书」
微软研究院 Yifan Yang 等人推出 SkillOpt,思路反直觉,不动模型权重,把「技能文档」当可训练参数。它在 52 个组合中表现最优,技能可迁移,代码已开源,还支持多操作。
LangFlow: 挑战离散扩散,探索下一代语言模型新范式
UIUC Ge Liu团队发布《LangFlow: Continuous Flow Matching for Large Language Models》,回归连续扩散架构。研究指出连续扩散受挫非先天缺陷,经优化,LangFlow让连续扩散在标准基准追平离散扩散,为多模态统一架构打通底层路线。
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。
谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路
阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。
字节最火的开源Agent项目,如何思考Agent的自我进化?
4月5日,LangChain创始人Harrison Chase阐述对Agent自我进化的思考,认为Agent系统可在Model、Harness、Context三层持续进化。知名开源框架DeerFlow联合作者Daniel也补充了团队思考。