评估框架」共找到 2224 篇相关文章

算法论文8

刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。

机器之心
新闻资讯7

因为AI编程,Tailwind CSS差点死了

2026年,备受AI智能体欢迎的Tailwind CSS框架团队却陷入困境,创始人Adam Wathan透露已裁掉75%成员。因AI写代码,人类不访问文档,付费产品无人买单,流量降40%、收入损失80%。虽有公司赞助,但仍需探索新商业模式。

机器之心
算法论文8

Code2Video:代码驱动、智能体协同、精准可控的教学视频生成

新加坡国立大学 ShowLab 团队提出 Code2Video,一种基于代码驱动的视频生成新范式。它以可执行代码为媒介,结合三智能体协同框架,解决了现有文生视频方法在教育场景的不足,在美学和教学效果指标上有明显提升。

机器之心
新闻资讯8

刚刚,首个能在机器人上本地运行的具身Gemini来了

谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。

机器之心
算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位
新闻资讯8

AI「生肉证明」堆爆GitHub!陶哲轩重磅发声:只会解题没用了

陶哲轩判断数学从证明稀缺进入过剩时代,AI 使证明生成加速,出现验证和消化跟不上的‘阻抗失配’现象。如 Erdős 问题有众多待评估方案堆积,而仅1196号案例跑通‘三件套’。他还指出学术评价体系将重写。

新智元
推荐文章8

端到端语音模型:从语音表征到模型架构

本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。

InfoQ
推荐文章8

AI Agent 记忆系统:从短期到长期的技术架构与实践

随着 AI Agent 应用发展,记忆系统成为构建实用 AI Agent 系统的关键技术。文章介绍了记忆基础概念、Agent 框架集成记忆系统的架构,阐述了短期记忆的上下文工程策略和长期记忆技术架构及集成,还分析了行业趋势与产品对比。

阿里云开发者
新闻资讯7

长上下文窗口、Agent崛起,RAG已死?

技术迭代下“RAG已死”论调出现,向量数据库Chroma创始人主张用上下文工程框架取代对“RAG”的狭义依赖。文章梳理业界不同观点,有人认为RAG在进化,有人称其成工程学科,也有人觉得会被Agent和长上下文取代。

机器之心
开源动态8

登顶Hugging Face GAIA全球榜首!中兴超级智能体终结「AI黑盒」时代

中兴通讯研发的超级智能体Co - Sight 2.0登顶Hugging Face GAIA全球权威榜单。它解决传统智能体痛点,有全链路可信计算框架等创新架构,其智能体工厂和开放标准助力构建生态,展现了智能体产业落地潜力。

新智元