交错式训练策略」共找到 2806 篇相关文章

新闻资讯7

AI 开发工具的隐形战场:新一轮 IDE 之争打响!

在AI开发工具领域,VSCode成主战场,但背后有技术和策略拉扯。开发者面临战略选择,VSCode有诸多限制,OpenVSX虽提供替代方案但插件不全,Cursor崛起引发微软动作,未来走向待察。

AI科技大本营
6

产品经理从0开始做网站,3个月时间实现每天从谷歌获取流量破千

Andy从产品经理转型为独立开发者,仅用3个月时间就实现了网站日点击破千。他通过不断优化产品、调整SEO策略、增加外链,最终在谷歌搜索中获得了显著的流量增长。

哥飞
新闻资讯8

刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代

OpenAI官宣下一代旗舰模型GPT - 6 Astra,定义其为「世界上最智能、对齐程度最高」的模型。它多项基准测试成绩惊人,在编程、计算机使用等多领域表现卓越,还改写科研纪录,不过因安全能力强暂未全开放。

新智元
新闻资讯7

Ilya新模型要来了?投资人爆料:今年最重要的发布!

a16z合伙人Martin Casado预告今年最重要的模型发布,线索指向Ilya Sutskever的新模型。SSI成立两年低调发展,获巨额融资,7月与英伟达合作。持续学习是焦点,但相关能力信息有限。

机器之心
算法论文7

做过十遍还要从头摸索?Agent 的记忆终于开始长成技能

MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。

深度学习自然语言处理
开源动态8

英伟达MoE新开源:一行import,微调加速3.7倍

英伟达开源NeMo AutoModel,基于Hugging Face Transformers v5,不改代码API,添一行import就能更快速微调MoE模型。实验显示,它能提升3.4 - 3.7倍训练吞吐,减少29% - 32% GPU显存占用。

量子位
产品应用7

Kimi Work 推出目标模式:连肝 24 小时做了本漫画书,已开源

Kimi Work 推出目标模式,设定完成条件可自动工作至达标。与 Claude Code、Codex 有差异,还具 Agent 集群能力。作者用其复刻 Logo、转换论文格式、制作漫画书并开源,指出目标模式类似模型训练

AGI Hunt
开源动态8

几张GPU干翻超算!耶鲁AI颠覆化学合成,实验成功率71%

近日,耶鲁大学李昊特团队开发 AI 系统 MOSAIC,将化学合成知识分 2498 个领域训练专家模型。测试中对超 35 种新化合物合成成功率达 71%,还完成难反应与新反应,相关论文发表于《自然》。

DeepTech深科技
推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区
开源动态8

首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」

港大团队提出FASTER,重新审视动作分块策略的反应延迟问题,提出快速动作采样方法。它即插即用,已开源。通过Horizon - Aware Schedule等创新,降低TTFA、提高闭环频率,实验显示能显著提升VLA反应能力。

机器之心