Agent评测」共找到 3184 篇相关文章

算法论文8

AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab

上海人工智能实验室等团队设计REST框架,在一个prompt里抛多问题模拟复杂推理场景。结果显示,DeepSeek - R1等模型高压下性能大幅缩水,REST能拉开不同模型差距,还揭示评测方法局限。

深度学习自然语言处理
新闻资讯8

刚刚,斯坦福宣布发起首个AI 主导学术会议

斯坦福大学James Zou教授宣布Agents4Science 2025会议,这是首个要求AI作主要作者和审稿人的学术会议。会议玩法独特,有三大目标,顾问委员会豪华,引发网友热议,将于2025年10月22日虚拟举行。

AGI Hunt
推荐文章7

2025-06 - 念头通达(月度小结)

作者 2025 年 6 月月度小结,称不再想读博、不追求研究工作,认为有让人幸福的工作。工作上 Agent 落地有收益,探讨平台化提效,还分享选业务的乐观心态,也提及消费和做视频情况。

chaofa用代码打点酱油
产品应用7

智谱发布龙虾基座模型GLM-5-Turbo,还适配了一个养龙虾的盒子

智谱发布专为龙虾场景深度优化的基座模型GLM - 5 - Turbo,从底层训练重塑,增强四项核心能力。发布评测基准ZClawBench,模型表现领先。还推出龙虾套餐和安全管理体系,助力企业实现算力自由与安全管控。

AIGC开放社区
开源动态8

26.7K 标星!GitHub 高分教程 Learn Claude Code:12 节课带你手搓一个 Cursor!

Learn Claude Code是shareAI - lab开源教学项目,目标是让人理解AI编程Agent工作原理。它有12节课,每节加一个机制,逻辑清晰。配交互式Web平台,文档‘心智模型优先’,还提供后续项目助知识落地。

开源星探
产品应用8

首个千万美金ARR的AI4S公司,完成AI设计新分子商业应用

2026 年初,AI 从「单一工具赋能」转向「场景深度共生」。MetaNovas 携 Agentic AI 先进材料发现平台亮相,以创新模式打破传统研发瓶颈,完成从「AI 设计」到「AI 落地」跨越,实现千万美金 ARR。

机器之心
推荐文章7

Skills火爆之后,我收集并整理了最近全网火爆的Skills,拿走不谢~~~

文章介绍 Agent Skills,称其是 AI 助理的「使用指南」,技能分浏览、加载、使用三阶段加载,有快且轻、跨平台、易分享等优势。还推荐多个优秀 skills 及相关工具网站,提醒从业务出发看待它。

小华同学ai
产品应用8

Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest

Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。

阿里云开发者
产品应用8

刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质

昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元