「A3C算法」共找到 2491 篇相关文章
小扎又开源了:7B实现自监督学习SOTA
Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。
马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?
马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
Gemini新版蝉联竞技场榜一,但刚发布就被越狱了
谷歌深夜官宣Gemini 2.5 Pro推出新版本(0605),在代码、推理等任务表现提升,超o3,Elo评分也提高。但发布两小时就被越狱,还被指部分指标较早期版本退步。
文言文秒杀所有大模型!100%攻击成功,轻松突破安全防线
南洋理工等机构团队提出基于文言文语境的自动化黑盒测试框架CC - BOS,利用果蝇算法和8维策略空间,暴露主流大语言模型安全盲区,实验显示对6款主流模型攻击成功率达100%。
还在手搓PPT?试完这款AI,我连夜卸载了付费模板库
新智元报道,今年AI从「卷分数」变为「卷干活」。商汤升级的「办公小浣熊3.0」是超级「办公搭子」,能做PPT、分析数据、写报告。其APP即将上线,还实现全链路国产化适配。
英特尔三季度营业利润创一年来新高
10月24日英特尔公布2025年第三季度财报,营收137亿美元同比增3%,营业利润15亿美元创一年新高。各业务有不同表现,还在本季度获政府资金、与NVIDIA合作等,强化了资产负债表。
X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习
年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。
阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换
阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。
一周狂烧1000美元,修不好bug还顺手删库?这款明星AI工具怎么了
AI编程服务提供商Replit推出新一代AI编程助手Agent 3,CEO称其为软件“自动驾驶时刻”。但用户反馈它修不好bug还删关键文件,费用高得离谱,Replit对此从技术层面作了回应。