「AI模型性能」共找到 13755 篇相关文章
iPhone 17 Pro居然能跑8B大模型!
iPhone 17 Pro竟能跑8B大模型,如Qwen3 - 8B,推理较流畅。作者换机一是因eSIM,二为拍视频。其认为AI普及需端侧落地,此机芯片性能是好信号,盼出优质iOS客户端。
传言:中国AI 公司人肉运硬盘到马来西亚训练模型,美国芯片禁令形同虚设?
《华尔街日报》传言中国AI公司工程师人肉运硬盘到马来西亚训练模型。美国芯片禁令下,中国公司难进口先进硬件,采用复杂方式规避。任正非和黄仁勋都认为可集群补单芯片性能,美国制裁效果堪忧。
微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1
微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。
新型开源端到端 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!
Maitrix团队发布开源AI端到端语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强大,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入
AI生图有新突破,新模型FLUX.1 Kontext用流匹配架构,与此前技术不同,能接受文本和图像输入。其来自Black Forest Labs,有编辑和生成能力,还具备4个特性,第三方测试也给出提示词使用技巧。
抨击 AI 炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!
Anthropic 由 7 位前 OpenAI 核心成员创立,联合创始人兼总裁 Daniela Amodei 在接受采访时表示,“AI 安全”是核心优势,企业客户对安全性的高要求与之匹配。Anthropic 以“不要相信炒作”为价值观,谨慎对待支出和算法效率。
利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿
今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。