强化学习算法」共找到 1910 篇相关文章

开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face
算法论文8

无损减少80%激活值内存,提升5倍训练序列长度,仅需两行代码

港中文(深圳)和上海交通大学团队提出 StreamBP 算法,通过线性分解和分步计算,将大语言模型训练激活值内存降至梯度检查点的 20%,在相同内存下最大序列长度为其 2.8 - 5.5 倍,代码已开源。

机器之心
新闻资讯7

M系列芯片一号人物准备离开,苹果高管流失正在失控

近期苹果高管变动不断,12月1日负责机器学习与AI战略的高级副总裁宣布退休,4日设计总监离职。此外,‘苹果芯片’之父也考虑离开,还有多位高管有离任计划。苹果发展策略保守,留不住人才,库克时代或近尾声。

机器之心
8

10万字Claude系统提示词泄露!我用DeeSeek 将它翻译成了中文版

Claude完整系统提示在GitHub泄露,虽真假未确认,但值得分享供参考。作者用DeepSeek将其翻译成中文版,该提示涵盖模型行为、工具使用等多方面,设计精妙全面,是AI交互设计“百科全书”,对提示词工程师极具学习价值。

AGI Hunt
推荐文章8

英伟达不是被计划出来的

英伟达成全球首个市值破5万亿美元企业,打破企业体量天花板想象。其GPU起初为游戏而生,CUDA曾是失败项目,却因深度学习需求成AI关键。其崛起证明伟大难被计划,创新源于多元互动。

芯师爷
算法论文8

StereoAdapter:北大首提自监督,适配水下双目深度估计

水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。

新智元
产品应用8

AlphaEvolve:陶哲轩背书的知识发现 Agent,AI 正进入自我进化范式

Google今年5月发布的AI系统AlphaEvolve,结合Gemini模型与evaluator,能发现新算法。它源于FunSearch,可多领域应用,运行机制类似自然进化,其关键组件evaluator对其发展很重要,也标志AI进入自我改进范式。

海外独角兽
新闻资讯7

理想汽车内部会曝光:必做人形机器人!全网急聘“最好的人”、连跳槽的前员工都要揪回来?

1月26日理想汽车CEO李想召开全员会,强调2026年是AI头部公司上车最后一年,最晚2028年L4落地。理想会强化具身智能定位,必做人形机器人,还将对研发组织变革,官网已放出相关研发岗位。

AI前线
算法论文7

为何95%的AI项目注定失败?回到未来,策略型代理AI才是正确路径

《代理AI的进展:回到未来》指出,当前95%的AI项目失败因企业缺乏消费模型的架构。文章提出‘机器中的机器’理论,论证策略型代理AI是企业转型路径,还阐述构建算法化企业生态的方法。

AIGC开放社区
算法论文8

从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践

当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。

机器之心