大模型发布潮」共找到 10170 篇相关文章

推荐文章7

新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型

Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。

AINLPer
产品应用8

一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠

长期以来,机器人系统多依赖专有模型,场景变化时需重新训练。如今具身智能步入下半场,它石智航通用具身模型AWE3.7用同一颗“具身脑”贯通多场景,回应了通用泛化命题。

量子位
开源动态8

Yann LeCun放出憋了20年的招:Meta开源V-JEPA 2世界模型

Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。

AGI Hunt
推荐文章8

被轻视的巨市场,厂做不好的Local Agent为何难?| 甲子光年

文章指出模型边际收益递减,AI竞赛规则生变,产业从‘参数竞赛’转向‘效率革命’。本地Agent有潜力,但主流产品体验差。GreenBitAI深耕低比特模型,推出Libra,有望撬开万亿美元增量市场。

甲子光年
推荐文章8

120页深度报告,搞懂今年模型和应用的现状与未来

Innovation Endeavors合伙人Davis Treybig发布《State of Foundation Models》(2025),从七个维度剖析AI产业现状与趋势。报告指出,AI发展迅速,模型成本高且迭代快,应用渗透各行业,智能体崛起,市场结构变革,公司运作方式也在重塑。

Founder Park
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
新闻资讯7

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上

DeepSeek发布模型DeepSeek - OCR,在实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始人称是里程碑。开发者Simon用Claude Code让模型在NVIDIA Spark上跑通。

InfoQ
新闻资讯7

一人公司火了,但Chatbot不是最机会 | 不是 for 人,而是 for Agent 。

在2026中关村论坛上,天工AI发布核心模型,公布昆仑万维AGI战略。天工AI董事长周亚辉在对话中谈中国模型竞争力、企业出海、产品价格等问题,认为企业级Agent是更金矿。

AI进修生
开源动态7

DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂模型推理技术!

DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。

PaperAgent
新闻资讯8

新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪

2025年AI飞速发展,模型发布密集,如OpenAI、谷歌等有诸多成果,中国造模型也表现出色。新智元9月7日将举办十周年峰会,邀多位嘉宾探讨前沿突破,还将发布报告,人类将达ASI临界点。

新智元