硅谷大厂」共找到 5266 篇相关文章

算法论文7

模型的第一性原理:(三)信息论篇

本文从信息论角度解读模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释模型底层原理,还阐述模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
新闻资讯7

Karpathy:模型交互的第三种范式来了?这是不是夸其词

Anthropic 上线 Claude Tag,可让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是模型 UI 第三次改,但评论区有质疑,不过有咖背书或成‘数字员工’。

AI工程化
算法论文8

小模型作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部模型

近年来,“参数越,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
算法论文8

瘦身不降智!模型训推效率提升30%,京东模型开发计算研究登Nature旗下期刊

京东探索研究院模型研究登Nature旗下期刊。其提出系统与方法,经四创新使模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
算法论文8

面对无解问题模型竟会崩溃?港中文&华为联合提出首个模型推理可靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示模型缺陷,还提出提高可靠性的对齐策略。

机器之心
推荐文章7

C端热战,B端暗涌:模型真正的战场才刚刚开始 | 《中国模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ
算法论文8

模型思考装上“猎鹰重装引擎” :腾讯混元 SEAT 重塑深度思考

本文深度解析腾讯混元最新发布的 SEAT 自适应并行扩展推理框架。它让模型 CoT 升级,应对复杂推理任务。该框架通过多轮并行推理和语义熵导航,解决模型深度思考的局限,且适配多种模型,性价比高。

AI科技大本营
新闻资讯7

城市抢龙虾,生龙虾,全民养龙虾!

AI圈佬和视龙虾(OpenClaw)为未来人工智能+的入口,各城市纷纷出台政策抢龙虾,模型公司推出龙虾苗,全民也积极参与养龙虾,龙虾相关话题十分火热。

AIGC开放社区
新闻资讯7

模型热度退潮,真正的技术创新者开始被「看见」

过去两年中国模型投资多是商业模式驱动,而技术投资注重创新。DeepSeek 出圈后,独立创新成主流。今年国内模型吸金热度下降,但智谱 AI、面壁智能仍获融资。面壁智能发布 MiniCPM 4.0,在多方面优化,展现端侧优势。

AI科技评论
开源动态8

硅谷豪赌算力烧到停电,中国团队反向出击!这一刀,直接砍碎Scaling Law

硅谷陷入算力战争,OpenAI、马斯克等豪赌Scaling。但Anthropic指出模型、算力多不一定聪明。Yuan 3.0 Flash登场,用RAPO+RIRM解决过度思考,降低推理token,在多模态任务表现出色,引发开发者关注。

新智元