「基础模型研发」共找到 8196 篇相关文章
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
Kimi新架构让马斯克叹服!17岁高中生作者一战成名
17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
一家营收千亿美元的公司,如何回应 AI 落地的策略问题
2025年9月19日,Qwen3和DeepSeek v3.1上线Amazon Bedrock。该产品秉持“Choice Matters”理念,为不同业务选适配基础模型,上架超二百余款模型。亚马逊云科技副总裁总结选模型要点,其策略影响AI落地进程。
登顶SuperCLUE DeepSearch,openPangu-R-72B深度搜索能力跃升
近日 SuperCLUE 发布 11 月 DeepSearch 评测报告,国产大模型 openPangu - R - 72B 名列第一。它采用 MoE 架构平衡效率与性能,经预训练技术优化和 DeepSearch 专项突破,彰显国产算力与大模型研发融合成效。
AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起
文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。
担心蒸馏问题,Meta限用Claude Code、Codex
据外媒报道,Meta限制员工在AI模型构建中用Claude Code和Codex,因担心涉及模型蒸馏,且随着AI使用成本上升,Meta想让更多开发工作迁至MetaCode,这揭开了AI Coding时代新问题。
谷歌神秘模型Kingfall泄漏!
近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。
ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式
华为GTS研发部AI数据团队提出EDCO方法,将样本难度估计与动态课程编排引入领域大模型微调。该方法用推理熵动态编排训练课程,让模型面对最有学习价值的样本,已被ICML 2026接收。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。