性能验证」共找到 2637 篇相关文章

算法论文9

快手搜索广告落地生成式检索新范式:UniGD生成-判别一体化重塑检索链路

快手科技针对工业搜索广告中生成式检索存在的目标割裂、新广告冷启动、异构广告语义差异等痛点,提出UniGD生成-判别一体化框架,经公开测试与工业验证,效果与业务收益提升显著。

量子位
产品应用9

OpenAI押注RSI,国产AI火速交卷!Flash叫板万亿大模型

OpenAI、Anthropic先后公开布局递归自我改进(RSI),国内云知声推出搭载RSI自迭代机制的U2-Flash大模型,本文带来实测表现与技术路径拆解,验证小激活规模对标万亿大模型的可行性。

新智元
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
推荐文章8

让AI自我进化,斯坦福新课免费教

斯坦福开设新课CS329A《自我进化AI智能体》,被奉为Agent学习新晋资源宝库。课程由实战派教授授课,介绍扩大模型规模、养成能听懂人话的AI、提升AI能力等内容,还探讨AI自我改进及智能体工作流等。

量子位
推荐文章8

人类研发时代结束?XYZ最强Search Agent横扫七大榜单,300个Agent跑通AI4AI全栈闭环

近日,XYZAI Lab发布两款Deep Search Agent,刷新多项评测SOTA成绩。其背后是新型AI4AI研发范式,让AI驱动研发闭环。XYZ团队用AI解决多方面问题,在Deep Search验证,未来有望拓展更多场景。

机器之心
新闻资讯8

阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4

近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。

PaperAgent
产品应用7

实测 Seed 2.1 Pro:从零到一,开源一个大学生就业补贴的公益网站

火山引擎在 Force 大会发布豆包大模型 Seed 2.1 Pro 系列,API 上线火山方舟。作者实测用其完成大学生就业补贴政策网站开源项目,展示模型 Coding 和 Agent 能力,还提及性能、成本等优势及后续计划。

AGI Hunt
产品应用8

verify-data:一个端到端的数据验数 Agent Skill

本文介绍端到端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。

阿里云开发者
新闻资讯7

首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半

Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。

AI工程化
产品应用7

回敬 Codex,Claude Code 推出 /goal 功能,不干完不睡觉

Claude Code随2.1.139版本推出 `/goal` 命令,设定完成条件后可持续工作至目标达成。它与Codex互相借鉴功能,且在设计上采用裁判分离,官方也给出目标制定建议,还带来其他更新。

AGI Hunt