A3C算法」共找到 2491 篇相关文章

产品应用8

Agent+Code,打开AI开发新范式

当下企业级AI叙事逻辑转变,传统AI应用有瓶颈。京东云在JDD 2025大会提出“深度应用”理念,推出“Agent+Code”新范式,其包含JoyAgent 3.0和JoyCode 2.0,还通过开源引领行业创新。

InfoQ
新闻资讯8

陶哲轩看傻:三破18年数学纪录!谷歌推出「AI爱迪生」,科研不再靠灵感?

5月中旬谷歌发布AlphaEvolve,30天攻克18年未解难题。它利用Gemini模型发现新算法,从AlphaGo获启发,能在编程空间搜索方案,或开启不靠‘灵感’的科学革命,还将改变科学家角色。

新智元
产品应用7

文档解析OCR全新升级,追平Gemini2.5pro,超越MinerU、碾压Qwen2.5VL-72B

CourseAI介绍PP - StructureV3实战、能力、性能与架构。它在通用版面解析等方面能力强,更新PP - OCRv5提升准确率,超主流OCR方案,轻且速度快,但遇特殊情况需重新训练。

CourseAI
开源动态7

DeepSeek最新模型意外泄露~

DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。

PaperAgent
新闻资讯8

李飞飞发布:全球首个多模态世界模型

李飞飞团队的World Labs发布全球首个多模态世界模型Atlas,是多模态自回归扩散Transformer,能相机控制生成、3D重建等,已向部分伙伴开放早期访问,未来将成底层模型。

量子位
8

在线等:如何优雅地分走鹅厂这600+万?

AI时代风口转变,Meta、字节跳动、腾讯等头部玩家扎进推荐系统统一建模方向。2026腾讯广告算法大赛与KDD联动,赛题聚焦‘大一统’,设高额奖金和创新奖,吸引全球顶尖人才参赛。

量子位
算法论文8

社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换

现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。

深度学习自然语言处理
开源动态8

人类造工具200万年,工具开始研究工具!97年天才少年带队,把“AI寻找研究方向”做成了现实

2026年AI开始研究AI(AI4AI),深圳EvoMap团队用蜂群协作做出产品EvoX。他们创新Agent组织方式,有实验数据支撑其效果,还开源成果AutoResearch解决AI痛点,在生活场景优化旧算法可行。

AI寒武纪
新闻资讯8

OpenAI和DeepMind大佬离职联手,誓用AI科学家实现室温超导!已融3亿美元

OpenAI后训练负责人和DeepMind的AI4S大佬离职成立Periodic Labs,专注用AI Agent改造科研,攻克室温超导等难题,已获3亿美元融资。团队目标是培养AI科学家,构建自主实验室,还将应用于产业。

新智元
开源动态8

阿里开源QwenLong-L1:首个以强化学习训练的长上下文推理大模型

LRMs扩展到长文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于长文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。

PaperAgent