大模型强化学习」共找到 8332 篇相关文章

新闻资讯7

谷歌开放世界模型一夜刷屏,AI游戏门槛归零时刻来了?

谷歌DeepMind开放世界模型Genie 3的实验性研究原型「Project Genie」,由Genie 3、Nano Banana Pro和Gemini提供技术支撑,有世界草绘、探索、重混三大玩法,但Genie 3仍处早期需改进。

机器之心
开源动态8

模型优秀大脑齐聚硬核开源聚会,SGLang社区举办国内首次Meetup

10月25日,SGLang联合美团、亚马逊云科技在北京举办国内首场Meetup。SGLang是开源高性能推理引擎,特性丰富。活动中大咖和开发者分享见解、进展、应用场景,展现其社区活力与发展潜能。

机器之心
推荐文章7

Agent当道、模型封装一切:AI 时代的产研人如何不被“优化”?

随着 Agent 普及,技术复杂性被模型封装,产研人面临挑战。InfoQ 直播栏目邀请嘉宾探讨应对之策,还分享 AI 项目经验,分析 AI 编程痛点、落地案例,以及产品上线障碍和商业化方向。

InfoQ
新闻资讯7

李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

9月2日,李飞飞团队发布多模态世界模型Atlas,引发好评。而国内影溯3月就开源InSpatio - World模型,有类似能力。影溯登顶权威榜单,还联合启动大规模空间智能3D数据开放计划。

量子位
算法论文7

Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调

Thinking Machines推出论文《LoRA Without Regret》,研究LoRA与FullFT达到相近表现的条件。通过实验发现,把握关键细节,LoRA可与FullFT性能相当,还探讨了关键因素、批大小效应等内容。

新智元
新闻资讯7

V4或Code要来?刚刚,DeepSeek-V3.1-Terminus发布!

DeepSeek线上模型升级为DeepSeek-V3.1-Terminus,单从名字看像是V3终极版,或在筹备V4及Code模型。deepseek - chat和deepseek - reasoner完成升级,此次更新改进语言一致性,优化Agent能力。

PaperAgent
开源动态8

最强开源0.9B级OCR模型!本地Agent、知识库都有救了!

百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。

开源星探
算法论文8

Nature重磅:AI和人脑的根本区别找到了,我们对“聪明”的理解可能全错了

2025年《自然·机器智能》研究指出AI和人类在‘泛化能力’上本质不同。人类泛化靠抽象,学习高效;AI泛化靠统计,学习笨重。未来AI与人应互补协作,而非谁取代谁。

AIGC开放社区
开源动态7

两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍

GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。

AIGC开放社区
新闻资讯7

OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark

OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。

AI寒武纪