「AI测试集」共找到 10975 篇相关文章

推荐文章7

Skills火爆之后,我收集并整理了最近全网火爆的Skills,拿走不谢~~~

文章介绍 Agent Skills,称其是 AI 助理的「使用指南」,技能分浏览、加载、使用三阶段加载,有快且轻、跨平台、易分享等优势。还推荐多个优秀 skills 及相关工具网站,提醒从业务出发看待它。

小华同学ai
算法论文8

SmartSearch:奖励驱动query精炼,让Agent中的RAG会“改错”

现有LLM搜索Agent忽视‘如何提问’致答案易出错。SmartSearch提出‘过程奖励+查询精炼’双机制,让Agent学会‘写不好就改’,代码已开源。经实验,它在六数据集全面领先,各机制缺一不可。

PaperAgent
推荐文章7

IDE消亡之年?Steve Yegge两句狠话:2026年还用IDE就不行,每天烧500–1000美元Token才合理

Steve Yegge和Gene Kim认为,从2026年1月1日起,依赖传统IDE的工程师会被拉开差距,这是‘生产方式换代’。他们还提到AI将重塑软件开发,无开发或成现实,新开发方式价值更优。

InfoQ
算法论文8

工业级文本转SQL新思路:成本暴降、超3000列超大数据库依然稳健

华中科大与复旦联合发布AutoLink框架,引入自主智能体,模拟人类工程师工作流。在不输入全量数据库模式下,实现对超大规模数据库模式的高精准链接与筛选,以低Token消耗刷新两大榜单纪录。

AIGC开放社区
新闻资讯7

Runway重夺全球第一!1247分碾压谷歌Veo3,没有千亿算力也能干翻科技巨头

Runway Gen - 4.5击败谷歌Veo3,以1247的ELO分数在Artificial Analysis榜单中重夺AI视频王座。它在多方面树立新标杆,虽有局限,但创始人认为其是通用模拟引擎,应用场景广泛。

新智元
算法论文8

规范对齐:回答前的深思,让安全与行为边界更清晰

OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。

深度学习自然语言处理
算法论文8

大模型推理学习新范式!ExGRPO框架:从盲目刷题到聪明复盘

上海人工智能实验室等团队提出经验管理和学习框架ExGRPO,能科学管理经验。与传统RLVR方法比,它在不同基准提升性能,尤其复杂推理任务,还揭示滚雪球效应,为模型推理训练提供新思路。

量子位
开源动态8

英伟达4段简短提示词,IOI夺金!开源模型也能征服最难编程竞赛

英伟达研究者提出GenCluster框架提升开源LLM解题能力,让开源模型gpt - oss - 120b在IOI 2025获金牌级别高分。它执行‘海选+筛选+比拼+提交’流程,优势明显,标志开源AI里程碑式突破。

新智元
新闻资讯7

马斯克亲自点名Karpathy迎战Grok 5!别神话LLM,AGI还要等十年

OpenAI创始元老Karpathy称AGI仍需10年,指出实现AGI难题多。马斯克点名其与Grok 5编程大战被拒。Karpathy还谈及LLM、强化学习、智能体等观点,主张合理看待AI发展。

新智元
新闻资讯7

惊爆提示词漏洞?Prompt 工程师开始失业

Noma Labs披露Salesforce Agentforce的“ForcedLeak”链式漏洞,攻击者串联“提示注入”致敏感数据外泄。ESET也报告AI勒索软件PromptLock。Prompt正转向Context,Prompt工程师或失业,价值向能组织语境流程者转移。

MacTalk