多任务处理」共找到 5758 篇相关文章

算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
算法论文8

大模型长脑子了?研究发现LLM中层会自发模拟人脑进化

帝国理工学院等机构研究人员发表论文,指出大型语言模型(LLM)学习中会自发演化出类似生物大脑的协同核心结构。研究对个模型剖析,揭示其内部处理规律,为大模型可解释性开辟新路径。

机器之心
算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在任务上超越人类标注数据。

深度学习自然语言处理
新闻资讯8

从刮胡子机器人到双臂神技!这家具身独角兽引爆亿级美元融资热潮

具身智能大热,Generalist AI展示「拂晓」仿人自适应机器人完成高难度任务。日前,非夕科技宣布完成C轮亿级美元融资。该公司由前DeepMind科学家创立,获英伟达投资,其机器人在领域有应用。

新智元
开源动态8

重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个

DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理类图像与近100种语言。

新智元
算法论文8

Agent接管EDA工作流,不只写脚本!浙大打通真实芯片设计闭环

大模型正以Agent形态进入真实EDA工具链。浙大卓成团队构建OpenClaw + FluxEDA联合架构,打通关键链路,解决模型操作真实EDA工具的难题,在任务中完成连续分析与优化闭环,推动EDA工作流范式转变。

新智元
算法论文8

ACL 2025 | GALLa:给代码大模型装上“透视眼”,看懂程序的“骨架”!

蚂蚁集团与上海交大合作的 GALLa 研究被 ACL 2025 主会录用。它利用图神经网络将代码图结构信息注入大模型,在 7 个模型和 5 个任务上提升性能,推理与普通 LLM 一致,不增成本。

PaperAgent
算法论文8

比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式

Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。

AIGC开放社区
新闻资讯8

比尔盖茨最新洞察:AI 时代动荡已至,三大风险,三个建议

比尔·盖茨在个人网站发布最新洞察,认为动荡的AI时代已至,AI影响广泛,政府需提出应对方案。他指出AI带来就业、安全、影响孩子成长三类风险,也有改善领域服务的可能,还给出三项应对建议。

特工宇宙
算法论文7

2篇论文,最新上下文工程技术一次性讲透!

上下文工程技术持续火热,文章分享10月两篇相关论文。ACE让模型给自己写「战术板」,在任务表现优;SA - ICL让LLM先搭框架再做题,在化学/物理准确率提升显著,还对二者做了横向对比。

CourseAI