模型训推」共找到 7964 篇相关文章

开源动态8

开源模型两个月内杀死比赛

过去60天,Vercel AI Gateway调用数据显示,开源模型Token调用份额从28%涨至62%,反超闭源模型。英伟达60亿美元入局扶持,闭源虽新降价仍失领先,开源走向大规模应用。

AI前线
产品应用7

时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。

去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。

开源AI项目落地
新闻资讯7

模型的价格战,打到硅谷了

今年夏天,AI价格战风向改变,OpenAI酝酿降价从Anthropic抢客户。7月,Anthropic半价平替Claude Opus 5,此前OpenAI发布GPT - 5.6打性价比。价格战因大模型购买逻辑变化、头部差距难支撑溢价等引发,虽让应用层受益,但对模型公司是资本耐力赛。

芯师爷
开源动态8

Sand.ai开源发布MagiCompiler:突破局部编译界限,定义性能上限

模型开发者面临速度与显存的两难选择,原生torch.compile有局限。Sand.ai开源MagiCompiler,突破传统编译界限,提出Compiler as Manager理念,解决算力与显存墙难题,性能实测亮眼,且接入简单。

机器之心
开源动态8

模型理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能向极限。它在数学竞赛、编程等可验证理基准上表现优异,成绩直逼顶尖大模型。其练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
新闻资讯7

OpenAI新模型,被曝秘密练中!万字硬核长文直指o4核心秘密

SemiAnalysis爆料,OpenAI正练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代模型o4基于GPT - 4.1练。强化学习成模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。

新智元
产品应用7

安全垂类小模型效果能超过大模型?看看以色列Novee的效果

跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段练和浏览器反馈提升能力,有投资说明有价值。

AI与安全
新闻资讯8

啊?微博7800美元的大模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后练成本仅7800美元。其为AI产业带来新思考,还将动微博AI应用发展。

量子位
新闻资讯7

翁荔创业大模型首秀!告别“120亿美元估值0模型

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
新闻资讯8

对话淘宝姜宇宁:如果你只低价商品,是不需要用大语言模型

淘宝姜宇宁团队上线RecGPT百亿参数荐大模型,对“猜你喜欢”功能技术升级。大模型赋予传统荐系统新能力,如让其“白盒化”、理解长上下文等。姜宇宁认为AI要创造商业价值,落到业务场景形成正向循环。

AI科技评论