代码强化学习」共找到 3001 篇相关文章

算法论文8

AAAI 2026|新突破:北大彭宇新团队提出可见光-红外终身行人重识别方法CKDA

终身行人重识别有重要应用价值,但现有方法在学习特定模态新知识时,会阻碍跨模态公共旧知识保留。北大彭宇新团队提出CKDA方法,解耦并净化不同模态信息,实现跨模态知识权衡,在相关基准上取得最优性能。

机器之心
产品应用7

DeepInsight x ChatBI:个人Agent助手养成计划

文章围绕将ChatBI打造成个人Agent助手展开,从用户视角拆解使用流程,分析提问、反问澄清、结果验证等环节的困难与解决办法,还提及MCP协议、通义千问3及阿里云百炼服务对Agent开发的助力。

阿里云开发者
开源动态8

AutoDev CLI:打造 AI 生成的 AI Agent 质量保障与验证架构

文章介绍AutoDev CLI,它基于AutoDev MPP架构构建,旨在解决上一代AutoDev智能体测试难题。阐述其起步、迭代、演进、集成过程,实现从AI生成代码到验证、生成测试系统的转变,带来可验证、可演化、可移植的优势。

phodal
新闻资讯7

具身智能的“生命线”:数据基石与未来路径 | GAIR Live 017

雷峰网举办具身智能数据线上论坛,三位嘉宾探讨其从数据采集到闭环学习全过程。指出具身智能数据挑战严峻,分享真机数据稀缺解决方案,认为仿真合成数据是必经之路,还谈及产学协同、数据服务等内容。

AI科技评论
新闻资讯8

马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化

特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。

新智元
推荐文章8

从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略

大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。

AI大模型应用实践
新闻资讯7

Murati翁荔陈丹琦公司发布首个产品,让大模型微调门槛暴降,要重新发明一个OpenAI

Thinking Machines Lab发布首个产品Thinker,让模型微调像改Python代码一样简单。它是用于微调语言模型的灵活API,降低了大模型微调门槛,受到业界关注。此外,该公司还尝试重新发明OpenAI,而OpenAI正打造社交模式。

量子位
新闻资讯8

刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。

新智元
推荐文章7

Vibe Working:AI Coding 泛化的终局想象 |AGIX PM Notes

文章围绕AI领域展开,探讨“Vibe Working”在AI编码及更广泛场景的应用,介绍工作流管理产品;还提及全球市场动态、多起AI相关商业合作与交易,以及ETF分红知识。

海外独角兽
新闻资讯8

英伟达新GPU,超长上下文/视频生成专用

在AI Infra Summit上,英伟达宣布推出NVIDIA Rubin CPX GPU,专为处理百万token级代码生成和生成式视频应用。它是首款为超大上下文AI量身定制的CUDA GPU,性能强且能效高,预计2026年底推出。

量子位