多任务训练」共找到 6583 篇相关文章

算法论文8

阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning

阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。

深度学习自然语言处理
产品应用7

GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
新闻资讯8

腾讯出手了!彻底入局Agent

腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点,如可一键发布到企业微信,具备工具调用、Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。

开源星探
新闻资讯8

Anthropic刚发布了一份「AI抢饭碗报告」:学历越高越「被抢」

Anthropic《经济指数报告》揭示,任务越复杂AI加速越猛,学历高的工作受影响大。还指出人机协作能大幅提升任务时长,不同国家AI应用有贫富和技术代差,也提到了‘去技能化’问题及对生产率的预测。

新智元
推荐文章7

A2A:智能体的协作总线

文章介绍了A2A协议,它是智能体系统的“协作总线”,能让不同智能体安全高效协作。阐述其核心使命、与MCP区别、核心概念、工作流实例,还描绘了“智能体社会”愿景,并给出基于官方文档的实现示例。

AIGC开放社区
产品应用8

美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经步骤研发,其性能评估表现佳,还给出招聘信息。

量子位
新闻资讯7

a16z:AI Coding 产品还不够

a16z两位合伙人发文称AI应用生成平台不是太而是太少。该领域发展如基础模型竞争,非赢者通吃,各平台找差异化共存。不同水平用户有定制平台,还应垂直细分。

Founder Park
产品应用7

Omni-Effects:首个统一特效生成框架

Omni-Effects是面向样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
产品应用8

AI编程学习:Chrome DevTools MCP 到底有强?

作者体验了Google新出的Chrome DevTools MCP,它在小红书自动发帖、YouTube智能观看等场景表现出色。与Playwright对比,其Token消耗低、报错处理稳。还揭示设计思路差异,给出上车指南。

AI产品自由