RL算法」共找到 770 篇相关文章

新闻资讯8

2025年深度学习趋势:从Transformer架构到无处不在的边缘计算

2025年深度学习成科技顶流,市场规模飙升。其发展受算力、数据、算法推动,应用于多领域。核心趋势包括Transformer架构发展、低代码开发等,同时也面临伦理、人才短缺等挑战。

AIGC开放社区
新闻资讯8

刚刚,谷歌重大突破!量子计算首次可验证,登《Nature》封面

谷歌宣布重大成果,全新量子回声算法在 Willow 芯片运行,解决原子相互作用问题比传统超级计算机快 13000 倍,结果可验证,相关研究登《Nature》封面,朝量子计算实用迈进一大步。

机器之心
算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
新闻资讯7

几月前的伤心事,ChatGPT突然翻出来提醒我?网友当场破防:太会捅刀子了!

今年4月,OpenAI发布ChatGPT「记忆」功能并不断升级,能形成个性化档案,但也带来问题,如提及伤心事、造成社死等,背后有无意的算法残忍和上下文崩塌两类问题。

新智元
开源动态7

SGLang 贴近硬件:用编译产物(PTX/SASS)评审 PR #26588、DeepGEMM 与架构迁移

本文从「编译产物评审」视角,分析 SGLang 的 PR、FlashInfer DeepGEMM 及 Ampere→Hopper 架构迁移案例。指出算法面和编译产物面会有分歧,编译产物 diff 能提前揭示执行路径变化,对开源项目有增益。

GiantPandaLLM
产品应用7

人形机器人终于学会洗碗了

Figure机器人学会洗碗,用的是叠毛巾和分包裹同款Helix架构,无新算法和特殊工程,仅增加新数据。该架构是端到端“视觉 - 语言 - 动作”模型,同一系统增数据就能学新技能。

量子位
开源动态7

让龙虾越用越聪明!普林斯顿大学为OpenClaw搞了个强化学习框架

普林斯顿大学研究团队发布强化学习框架OpenClaw - RL,能捕捉用户反馈与环境结果信号,有独立解耦异步机制,融合打分与文本指导,经真实场景验证效果良好,蹚出自我进化新路径。

AIGC开放社区
新闻资讯8

“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿

Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。

InfoQ
产品应用7

用户被通知烦到关掉 Instagram?Meta:我们反思了,用 AI 给自己“限流”

Meta为Instagram推出新机器学习排序框架,引入‘多样性算法’,在现有互动模型上加‘多样性过滤层’,通过‘乘性惩罚’减少重复内容推送,解决通知疲劳,还计划探索新策略和用大语言模型优化。

InfoQ
新闻资讯7

ICU昏迷不醒,AI判决生死!取意愿平均值,细思极恐

美国华盛顿大学研究「AI代理人」,用算法预测昏迷患者生死意愿。虽初衷似是人道主义实验,但AI仅基于历史数据推断,易成社会偏见延伸,还会影响决策,掩盖真正意愿,引发伦理担忧。

新智元