深度确定性策略梯度」共找到 1633 篇相关文章

产品应用7

Gemini CLI 新升级:深度集成 VS Code,终于不用在终端和编辑器之间反复横跳了

Google发布Gemini CLI重要更新,实现与VS Code深度集成,从架构层面解决AI编程助手的上下文感知问题。新版本有工作区上下文感知和原生差异对比界面两个核心功能,还给出部署要求。

AI工程化
新闻资讯7

“Claude Code更新废了”!热议Issue:思考深度下降67%,已无法胜任复杂的工程任务

AMD的Stella Laurenzo分析发现,Claude Code某次更新后思考深度降67%,无法胜任复杂工程任务,行为走样。团队回应redact - thinking是UI改动,2月两项改动或有影响,但网友并不买账。

量子位
新闻资讯8

深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密

这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。

InfoQ
推荐文章7

AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤

文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。

阿里云开发者
算法论文8

AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠

合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。

机器之心
新闻资讯7

Claude Opus 4.6差评如潮!思考深度暴跌67%,AMD总监6852次日志打脸

Claude Opus 4.6遭差评,用户感其「变笨」,输出浅、易失败、违规提示增多。AMD总监用6852次日志证明其「思考深度」降67%,价格高却性能倒退。Anthropic虽称优化,但用户不满默认值被改。

新智元
算法论文8

ICLR 2026 Oral|中科院团队提出新框架「SparseRL」,深度强化学习可自动生成高性能CUDA代码

中科院计算所团队提出 SparseRL 框架,将深度强化学习引入稀疏 CUDA 代码生成任务。实验显示,在 SpMV 任务上编译成功率提升 20%,执行速度提升 30%。该成果已入选 ICLR 2026 Oral。

机器之心
开源动态8

3.8K Star!港大开源 AI 量化神器:一句话生成量化策略,普通人也能玩懂!

港大开源的Vibe - Trading在投资圈火了,它是AI驱动的多智能体金融工作台,能将自然语言请求转化为交易策略等。有多智能体协作架构,内置64个金融技能、29个智能体团队预设,提供4种安装使用方式。

开源星探
产品应用8

将科研脏活累活真·丢给AI!上海AI Lab推出深度科研智能体FlowSearch

上海人工智能实验室推出深度科研智能体FlowSearch,它由动态结构化知识流驱动,有三大核心模块。在多个科研基准上性能领先,能让科研更高效,标志科研智能体迈向新阶段,还为未来系统奠定基础。

量子位
新闻资讯8

深度机智和他们的另一条路:用人类第一视角数据训练基座模型|甲子光年

3月27日,深度机智联合推出具身通用智能基座模型系统PhysBrain 1.0,引入人类第一视角数据,解决传统模型问题。其创始人陈凯等坚持用此数据构建模型,突破传统,引领行业新方向,且中国在具身智能领域或借此建立自主技术体系。

甲子光年