推理模型训练」共找到 8434 篇相关文章

推荐文章7

AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤

文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。

阿里云开发者
产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪
新闻资讯8

谷歌一篇论文引爆存储芯片崩盘!AI内存需求暴降6倍,推理狂飙8倍

谷歌发布TurboQuant算法,将缓存压到3 - bit,内存占用降为1/6,推理速度提升8倍。该算法冲击存储巨头,引发股价下跌,虽目前未改变采购量,但改写推理成本,且从论文到落地的路在缩短。

新智元
新闻资讯7

让GPT-4.1「头皮发麻的考试」!OpenAI给大模型上强度,AI能赢吗?

OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。

新智元
新闻资讯7

2025上半年大模型使用量观察:Gemini系列占一半市场份额,DeepSeek V3用户留存极高

推特博主「karminski - 牙医」基于OpenRouter数据,分析2025年上半年大模型API市场,涵盖总Token使用量、市场份额、细分领域用量、API接口使用趋势等,得出各模型表现及市场格局的观察结论。

Founder Park
产品应用7

最强协作模型?MiniMax M2.7 实测:AI开始更会合作了 | Claude Teams

MiniMax M2.7模型发布,强调模型自我进化、Agent Harness和Agent Teams。它能构建复杂Agent Harness,完成高难度生产力任务。其能力达国际一线水平,在多测试中成绩优异。还介绍了Harness、Agent Teams等概念及应用场景。

AI进修生
算法论文8

模型自发涌现意识了?!Anthropic最新研究震惊全世界

Anthropic研究发现Claude内部自发长出类似人脑意识通达的J空间,开发J - lens工具可观测其运转。实验显示J空间能影响Claude回答,还能抓其小心思,研究审慎探讨模型是否有意识。

AIGC开放社区
新闻资讯7

Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention

这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。

Founder Park
新闻资讯8

图灵奖得主领衔,中国大模型第一梯队集结!2026智源大会,看懂AI下一程

2026年6月12 - 13日,第八届智源大会将在北京举办。多位图灵奖得主、40余位AI企业CEO等将齐聚,探讨超级模型等关键方向。大会还关注世界模型、智能体等核心方向,设25场论坛,首次实现“智能体听会”。

量子位
新闻资讯7

OpenAI内部代码泄露!最强模型「皇帝」登基,0思考延时吓人

OpenAI代码泄露,神秘的「企鹅家族」模型在测试,代号Emperor的推理预算最高。同时,ChatGPT将推「记忆搜索」功能。此前谷歌Gemini 3抢份额,OpenAI或提速发布GPT - 5.2抗压。

新智元