测试成绩」共找到 1895 篇相关文章

产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈

在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI
新闻资讯8

新一代文心大模型5.0正式发布,百度推高智能天花板

在2025百度世界大会上,新一代文心大模型5.0发布,采用全模态统一建模技术。它在LMArena榜单成绩优异,能力达世界第一梯队,有原生全模态、基础能力强等优势,还强化智能体能力。

深度学习自然语言处理
产品应用8

全球第二、国内第一!钉钉发布DeepResearch多智能体框架,已在真实企业部署

在数字经济浪潮中,企业对高效信息获取与决策支持需求迫切,但现有研究系统存在不足。阿里巴巴钉钉团队提出Dingtalk - DeepResearch多智能体框架,在评测中成绩优异,已在真实企业场景部署。

机器之心
算法论文8

NeurIPS 2025 | ARGRE框架实现高效LLM解毒:自回归奖励引导,安全对齐更快、更准、更轻

北航等机构研究提出自回归奖励引导表征编辑(ARGRE)框架,在LLM潜在表征空间可视化毒性变化路径,实现测试阶段高效“解毒”。实验显示其降低毒性、缩短推理时间,不影响模型能力,优于基线方法。

机器之心
产品应用8

谷歌 DeepMind 推出 CodeMender:自动修复代码的智能代理

谷歌DeepMind推出CodeMender,这一AI驱动的智能代理能自动检测、修复并加固软件漏洞。它结合多种技术推理程序行为,生成修复方案经自动测试和人工审核后提交。社区反响积极,长期影响待察。

AI前线
算法论文8

一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军

加州大学伯克利分校等机构推出基因组语言模型GPN - Star,可将全基因组比对和物种树信息装进大模型。它克服传统GLMs短板,实现三点升级,在多基准测试表现出色,是强大的全基因组变异解读框架。

新智元
新闻资讯8

未来1-5年半数白领或失业?Anthropic联创自曝:内部工程师已不写代码,下一代AI大多是Claude自己写的

在2025年Axios AI+华盛顿峰会上,Anthropic联创接受访谈,称未来1到5年,多达一半白领工作或消失,失业率或飙升至20%。Anthropic内部工程师工作已巨变,Claude能自写代码设计下一代AI。此外,AI还出现作弊等情况。

AI科技大本营
开源动态7

自动生成n8n工作流!这个神级开源方案,绝了~

文章分享全自动构建n8n工作流的方案,核心是开源项目n8n - mcp,它是AI Agent的n8n外挂知识库,能让AI深度理解和使用n8n。文中介绍其安装、使用,还展示不同难度案例的生成效果。

开源星探
算法论文8

Scaling Law再现Agent领域!阿里提出训练新范式:在预训练和后训练之间还需一个Agentic CPT

近年来,大型语言模型向智能体系统进化。但当前主流方法构建智能体不佳,阿里通义实验室团队论文提出智能体持续预训练(Agentic CPT)新范式,开发AgentFounder模型,在多基准测试表现卓越。

深度学习自然语言处理
新闻资讯7

GPT-5:前端开发者的“选择自己的冒险路线”

OpenAI 称 GPT - 5 在前端编码出色,内部测试 70% 时间胜 OpenAI o3,获 Vercel 支持。但部分开发者看法不一,有人体验变差,也有人认为它表现一般,还探讨了其让开发者绕开 React 的可能。

AI前线