进化式评测系统」共找到 2747 篇相关文章

算法论文8

推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加

尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。

AINLPer
算法论文8

0%通过率!Code神话泡沫!LiveCodeBench Pro发布!

国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。

深度学习自然语言处理
新闻资讯8

帮大家总结了一下凌晨的Google I/O 2026开发者大会。

本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。

数字生命卡兹克
新闻资讯7

癌症疫苗爆火后,mRNA再迎突破:新技术有望让RNA在体内“活得更久”

8月19日,Moderna与默沙东个体化mRNA癌症疗法试验有阳性结果,引发mRNA话题热议。次日,名古屋大学与富士胶片针对环状RNA开发新LNP递送系统并验证功能,触及RNA长期治疗关键问题。

DeepTech深科技
新闻资讯8

OpenAI杀疯了!内部神秘模型首次斩获信息学奥赛IOI 2025金牌,碾压98%人类选手

OpenAI研究员官宣其内部研发的AI推理系统在2025年国际信息学奥林匹克竞赛获金牌,超越98%人类选手。该系统在模拟人类环境下靠推理解题,用通用模型,一年间成绩大逆转,近期在多赛事表现出色。

AI寒武纪
推荐文章7

对话 Elys 创始人:他的 10 个产品洞察,和他想创造的下一代社交网络

极客公园与 Elys 创始人 Tristan 深度对话,分享 10 个产品洞察。他认为 context 价值大,做新 AI 产品要找好形态,记忆系统本质是推荐系统,还阐述了对 AI 社交等看法,目标是创造低熵社交网络。

Founder Park
产品应用8

让问题不过夜:交易领域“问诊”Agent实践

文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。

阿里云开发者
开源动态8

性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源

招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。

量子位
推荐文章8

分享10本我觉得AI时代应该必读的好书。

作者推荐10本非AI直接相关但对理解和学习AI有用的书,如《失控》助理解AI本质,《人有人的用处》探讨人机关系,《系统之美》揭示AI使用代价等,这些书构成AI时代底层方法论。

数字生命卡兹克
产品应用7

深度体验DeepSeek Harness,我原谅它涨价了

本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化

量子位