大模型发布潮」共找到 10237 篇相关文章

算法论文8

经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%

现有的 RL 驱动的深度思考模型系统面临准确率与效率的「跷跷板」困境,北邮百家 AI 团队提出 LightSearcher 框架,解决了这一痛点,在保持准确率的同时,显著提升了工具调用效率。

机器之心
算法论文7

OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?

围绕模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。

DeepTech深科技
推荐文章8

卡帕西推荐的AI Coding指南:3招教你效率翻倍

神卡帕西和OpenAI总裁转发推荐的AI Coding指南,由Peter Steinberger撰写。指南给出三关键策略,即按任务类型选对模型、重构工作流、做好人机分工,还分享实用小技巧。

量子位
开源动态8

Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死

当Ilya断言模型未来在于架构创新时,中国团队推出全球首个可规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。

量子位
开源动态8

跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现

9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。

OpenMMLab
开源动态8

The Batch:820 | Qwen3 向 DeepSeek-R1 发起挑战

阿里巴巴发布八个型语言模型权重,含两个 MoE 架构和六个稠密模型。预训练数据达 36 万亿 token,支持 119 种语言及方言。测试中 Qwen3 家族表现出色,或终结 DeepSeek - R1 霸主地位,设计用于智能体系统。

DeeplearningAI
算法论文8

通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持

LLM.265研究发现,视频编码器是高效的模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。

新智元
开源动态8

美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破

美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。

AIGC开放社区
新闻资讯7

揭密MiniMax不为人知的B面

第一批AI模型公司上市潮来临,MiniMax营收增长显著。它采用“B+C全都要”商业模式,B端业务靠API调用,覆盖多领域,毛利率高。其B端战略分三层,靠全模态布局和模型能力扩张版图。

芯师爷
开源动态8

标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型

量子位