长任务跑分」共找到 2684 篇相关文章

算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
产品应用7

LLM加速利器LMCache,极大降低GPU资源消耗

LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。

GitHubStore
开源动态8

腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖

腾讯AI Lab推出全开源智能体框架Cognitive Kernel - Pro,解决现有开源框架依赖付费工具问题。它有模块化架构等核心设计,创新训练方法,在多任务中表现出色,降低外部依赖,相关论文登HuggingFace热榜。

量子位
新闻资讯8

Google重磅上线通用世界模型Genie 3 - 此即未来。

Google发布世界模型Genie 3,它与Sora等AI视频产品本质不同,像可实时演算的模拟器。Genie 3解决了前辈无法调和的矛盾,在交互、时、控制等方面有突破,虽有局限,但打开新世界大门。

数字生命卡兹克
产品应用8

4K-Agent:可将低分辨率图像提升至4K高清智能体

图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。

AIGC开放社区
算法论文8

AST | 西交大刘子扬、陈刚等:直接嵌入流场特征的智能化气动外形优化经验学习框架

传统气动外形优化方法有局限,本文提出智能化优化经验学习框架,结合DNN流场预测模型与DRL优化方法,还提出自适应网格再生成技术与Sigmoid奖赏函数,经验证效果良好,为气动优化提供新路径。

力学与人工智能
新闻资讯7

微软为3万名政务人员提供Copilot AI

CNBC消息,旧金山市宣布为3万政府人员提供微软Copilot AI,用于行政工作提效。经六个月试点,该AI为人员每周提效5小时,还能处理多语言翻译等事务,使旧金山成全球应用AI最多城市之一。

AIGC开放社区
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。

深度学习自然语言处理
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
推荐文章7

揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。

阿里云开发者