「复合模型架构」共找到 8523 篇相关文章
对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”
阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。
OpenAI推理第一人创业了:要造“活到老学到老”的AI,先来融它70个亿
OpenAI推理模型第一人Jerry Tworek离职不到一个月就创业,新公司Core Automation计划筹集10亿美元,要做具备「持续学习」能力的新型AI模型,解决主流模型‘训完就上线’、能力固定的问题。
登顶SuperCLUE DeepSearch,openPangu-R-72B深度搜索能力跃升
近日 SuperCLUE 发布 11 月 DeepSearch 评测报告,国产大模型 openPangu - R - 72B 名列第一。它采用 MoE 架构平衡效率与性能,经预训练技术优化和 DeepSearch 专项突破,彰显国产算力与大模型研发融合成效。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
Scaling Law 仍然成立,企业搜广推怎么做才能少踩“坑”?
InfoQ《极客有约》X AICon 直播栏目邀请京东、荣耀等专家探讨生成式推荐落地洞察。指出搜广推领域 scaling law 仍成立,大模型改变特征工程等,还分享了系统架构、模型应用等方面经验及挑战。
谷歌神秘模型Kingfall泄漏!
近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
LeCun离职前的吐槽太猛了
年底将离开Meta的LeCun在播客直言,不看好大语言模型通往AGI,也吐槽Meta封闭。他将创办开源公司AMI研究世界模型,认为其与LLM本质不同,还回顾AI学习史引出JEPA架构。
AI 味的原因找到了,都是 NTJ 惹的祸
作者因常被说说话像AI,好奇大模型MBTI类型。实验发现Claude - 4、Gemini - 2.5 - pro、GPT - 4为INTJ,DeepSeek是ENTJ。分析了大模型呈现NTJ特质的原因、AI味根源,还给出让大模型有情感的思路和使用技巧。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。