流中强化学习」共找到 2766 篇相关文章

新闻资讯8

雷军:小米一直有一颗芯片的梦想

9月25日晚雷军年度演讲深情坦言,小米一直有造芯梦想。其造芯始于2014年松果电子,澎湃S1虽量产但未成功,后停掉SoC研发。2024年小米成功片3nm芯片,玄戒O1首发于小米15S Pro,表现出色,但雷军称其成功只是第一步。

芯师爷
推荐文章8

Life of a Token:像调试代码一样看懂大模型如何生成 Token

文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差、KV Cache 等概念及 GPU 性能瓶颈和优化方法。

AI前线
算法论文8

56倍加速生成式策略:西交大提出EfficientFlow,迈向高效具身智能

生成式模型在机器人和具身智能领域面临训练依赖大量数据、推理慢的问题。西安交通大学团队提出EfficientFlow,融合等变建模与高效匹配,提升数据效率,压缩推理迭代步数,在多基准实现SOTA,推理提效显著。

机器之心
推荐文章8

Thinking Machines又发高质量博客:力推LoRA,不输全量微调

Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务 LoRA 与全量微调效果接近,大数据量稍吃力,强化学低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。

机器之心
算法论文8

抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅

视觉推理任务,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理实时生成、执行并迭代 Python 工具,在多类任务显著提升性能,实现范式跃迁。

深度学习自然语言处理
新闻资讯7

OpenAI夺金IOI,但输给3位国高

OpenAI官宣其推理模型在今年IOI线上竞赛成绩刷新纪录,总分533.29,全球330名人类选手排第六,AI参赛者居首。不过其没比过三位国高生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。

量子位
新闻资讯7

芯片企业突然官宣涨价!

1月27日,微半导对MCU等产品涨价15% - 50%,称受供应紧张、成本上升影响。国科微也宣布自1月起对KGD产品调价,最高涨80%。国内半导体企业通过价格策略应对波动,深化布局与投入。

芯师爷
算法论文7

苹果AI选Mamba:Agent任务比Transformer更好

苹果新研究指出,在长任务、多交互的Agent式任务,基于SSM架构的Mamba在效率与泛化能力上超Transformer。虽Mamba有局限性,但引入外部工具后性能显著提升。

量子位
算法论文7

Nature重磅研究:大模型让你变得更聪明还是更笨了?创造力增强还是扼杀了?

《自然》研究表明,大语言模型对创造力的影响取决于任务。简单任务,它像灵感助推器,分担认知负荷;复杂任务里,易致‘创意固化’,长期依赖还可能使大脑‘变懒’。需按需调节使用。

AIGC开放社区
算法论文8

「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配

快手与清华合作团队发现大语言模型结果监督强化学,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试展现优势,训练更稳定。

量子位