开放域RL」共找到 866 篇相关文章

新闻资讯8

拥有Github 的微软终于出手,发布一键生成全栈应用的GitHub Spark!

微软发布GitHub Spark,能以自然语言生成全栈应用并一键部署,默认用Claude Sonnet 4。它遵循微应用理念,有强大功能体系,深度集成GitHub。开发者看法不一,目前向Copilot Pro+用户开放,或改变市场格局。

AGI Hunt
开源动态8

苹果在WWDC提到的本地模型,这家公司把它提速了220倍

苹果在WWDC开放本地语言模型API,让iPhone等有了“AI大脑”,但开发者面临模型运行慢问题。国产团队面壁智能发布MiniCPM 4.0,端侧处理长文本提速惊人,从多层面创新实现,还补上推理框架缺口。

花叔
开源动态8

等了五年,AI 终端 Warp 终于开源!OpenAI 赞助

Warp是用Rust写的AI终端,其创始人Zach Lloyd宣布开源,代码已推到GitHub。OpenAI是开源仓库「创始赞助商」。开发瓶颈转移,Lloyd提出开放智能体开发模式。Warp还内置编程Agent,有云端Agent编排平台Oz。

AGI Hunt
新闻资讯7

八年研究沉淀,原方智能试图让机器拥有关于世界的「信念」

原方智能正式启动,由林浩鑫与唐开强创立,技术源于 LAMDA 团队八年研究。其目标是使机器在物理世界形成对世界的'信念',以世界模型为核心技术路线,将研究成果推向开放物理世界。

机器之心
新闻资讯8

Claude Mythos官宣!性能碾压Opus 4.6,因太危险遭「囚禁」

Anthropic官宣最强模型Claude Mythos预览版,性能全方位碾压Opus 4.6。但它存在致命缺陷,攻击安全漏洞能力超多数黑客。Anthropic暂不向公众开放,联合巨头开展安全计划,称需各方共筑网络安全。

量子位
算法论文8

大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
开源动态8

阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜

阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。

量子位
新闻资讯7

DeepSeek多模态真的来了?识图模式已开始小范围灰度

4月29日,DeepSeek多模态团队负责人陈小康在X发布动态暗示多模态进展。部分用户在DeepSeek官方App灰度到“识图模式”,这是其主线产品首次有图像理解能力模式,此前多模态人才有流失,官方未说明开放细节。

DeepTech深科技
开源动态8

VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源

中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领研究提供新范式。

机器之心
推荐文章7

10个面向前端开发者的MCP服务器

MCP是Anthropic推出的开放标准,让大模型与外部系统交互。本文介绍10个面向前端开发者的MCP服务器,如Canva、Dart等,还提及实验性的Angular MCP服务器,阐述各服务器功能及对开发者的帮助。

InfoQ