大模型推理训练」共找到 8536 篇相关文章

产品应用8

Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍

Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。

InfoQ
7

突然变强!速度翻4倍,GPT Pro惊现「神级」操作,网友怀疑GPT-5.5已就位

OpenAI悄悄完成GPT Pro模型升级,其速度提升、视觉理解能力增强。同时,代号「Spud」的GPT - 5.5已完成预训练,发布在即,AI竞争将更激烈。

新智元
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
开源动态8

彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器

商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。

量子位
产品应用8

Qwen3.5实战教程:从0到1掌握本地部署与微调

阿里通义千问团队发布Qwen3.5系列小模型,打破“大模型=高成本”惯例。本文全面剖析该系列模型,涵盖核心特性、本地部署实战、模型微调实战,还给出技术细节与问题解决办法。

机器学习AI算法工程
算法论文8

刚刚,加入腾讯的姚顺雨发表首篇Paper~

腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。

PaperAgent
产品应用8

逛完WAIC,我们发现这家芯企已经把端侧AI“场景落地”做实

7月17 - 20日,世界人工智能大会召开,端侧AI成热点。瑞芯微展台展示大模型、Agent、AI+应用,多方案已量产落地,其双轨架构优势突出,还规划了产品路线图。

芯师爷
新闻资讯7

这个叫STOP AI 的极端组织要求:立即销毁ChatGPT

Stop AI组织自称「非暴力公民抵抗组织」,发布政府诉求清单,要求禁止训练超10^12 FLOPs神经网络,销毁GPT - 4等模型,还提出多项激进诉求,引发网友热议。

AGI Hunt
新闻资讯8

苏妈和李飞飞炸场CES!AMD AI全栈野心显露:从云端到个人PC,AI芯片性能四年要飙1000倍

今年 CES 上 AMD 专场演讲亮点多。苏姿丰称未来五年50亿人每天用 AI;李飞飞和她探讨空间智能与世界模型;Helios 平台受关注,MI455 GPU 解决内存墙;Ryzen AI 推动 AI 下放到本地。

AI前线
算法论文8

东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速

东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。

机器之心