深度思考大模型」共找到 8303 篇相关文章

产品应用7

从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍

10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。

InfoQ
开源动态8

英伟达龙虾模型开源,12B激活登上成功率全球第四

英伟达发布专为龙虾打造的开源模型Nemotron 3 Super,总参数120B,激活参数12B,在龙虾模型基准PinchBench上成功率全球第四。该模型结合Mamba与Transformer架构,引入多项创新技术,还开源了模型权重、数据集等。

AIGC开放社区
新闻资讯7

9B 模型“平替”GPT-4o ?!面壁赌对OpenClaw端侧AI,内部上演一人月产65万行代码的效率核爆

2023年面壁智能转攻端侧大模型,起初遭质疑,后获市场认可。今年发布开源全模态模型MiniCPM - o 4.5,年中还将推AI硬件松果派。其内部有“一人公司”趋势,对未来端侧智能发展有清晰判断。

AI前线
开源动态8

DeepSeek-V3.2正式版发布,将开源模型的能力推向极致

DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。

AIGC开放社区
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
算法论文7

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程
产品应用7

夸克高考,背后藏着的其实是垂类场景「深度研究」方法论

夸克早在2019年就提供高考志愿填报服务,今年推出“志愿报告”功能。其“志愿报告”Agent已生成超1000万份报告,采用PDCA模式给出指导。夸克构建可信度体现在数据库和自研模型上,还降低了幻觉率。

特工宇宙
开源动态8

不会拍照有招了!北大彭宇新团队开源首个美学指导大模型Venus,帮你拍好照|CVPR 2026

北大彭宇新教授团队针对现有大模型在摄影指导上的不足,定义美学指导任务,构建数据集AesGuide,提出美学指导大模型Venus。相关论文被CVPR 2026接收并已开源,Venus在多项评测中优于现有方法。

量子位
新闻资讯7

林俊旸果然创业了!一个“Qwen负责人”头衔值135亿

前阿里千问大模型负责人林俊旸离职后创业,种子轮目标估值20亿美元。他曾深度参与阿里多个大模型项目,离职首篇长文提出“Agentic Thinking”,或为创业方向。

量子位
新闻资讯8

中国团队引领太空算力:首次太空在轨部署通用大模型,发2800颗卫星服务数亿硅基智能体

岁末年初,全球AI竞争聚焦太空算力,中美你追我赶。美国Starcloud宣布在太空跑通大模型,中国国星宇航发布全球首个服务硅基智能体的太空算力网,计划用2800颗卫星服务数亿个硅基智能体,还实现通用大模型在轨部署。

量子位