语言处理」共找到 1988 篇相关文章

算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元
产品应用8

【一手实测】字节豆包 1.6 + Trae + 火山 MCP + FaaS:AI Agent 开发部署全流程体验!

本文作者实测字节豆包1.6系列模型,用其设计落地页,还借助Trae、火山方舟MCP等实现AI Agent开发部署全流程。测评显示豆包1.6多模态能力强,处理复杂指令效果好,价格实惠,字节AI云原生生态前景佳。

AI进修生
新闻资讯7

谷歌迎来“DeepSeek时刻”!TurboQuant引爆AI圈、全球开发者疯狂复现:6倍无损压缩,内存股集体暴跌

谷歌研究院发布 TurboQuant 压缩算法,能在提升速度、保持准确性的同时,降低大语言模型内存占用,可将键值缓存压缩至少 6 倍,速度最高提升 8 倍。该技术无需额外训练,精度零损失。目前虽未大规模部署,但已引发内存股下跌。

AI前线
开源动态8

Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%

为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。

AINLPer
新闻资讯7

具身智能开始进入「下半场」:从会干活到干完活

具身智能正处热门,国内今年上半年赛道融资额高涨。但钱与落地有落差,拉格朗日具身技术自研 Agentic OS,采用分层智能架构处理工程问题。还推动工序重构,制定技能矩阵和排期计划,其团队背景多元,赌让机器人干完活路径。

AI科技评论
算法论文8

RL在Agentic Reasoning中的作用:拨开迷雾,看清本质

近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。

深度学习自然语言处理
算法论文8

破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”

语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。

量子位
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元
开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区
产品应用8

中文版Nano Banana来了?Qwen-Image-2.0炸场:1K长文本硬吃,中文生图彻底不拧巴了

AI生图曾有文本长易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token长文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。

量子位