「性能实测」共找到 2308 篇相关文章
社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。
抨击 AI 炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!
Anthropic 由 7 位前 OpenAI 核心成员创立,联合创始人兼总裁 Daniela Amodei 在接受采访时表示,“AI 安全”是核心优势,企业客户对安全性的高要求与之匹配。Anthropic 以“不要相信炒作”为价值观,谨慎对待支出和算法效率。
真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件
蚂蚁上线AI健康管家APP——AQ,有超百项AI功能,连接超5000家医院、近百万医生等。它能追问识药看皮肤,打通硬件,设语音通话。凭借技术和生态优势,实现从技术工具到健康管家的跃迁。
Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹
在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。
GUI定位还在玩「非黑即白」?浙大团队提出GUI-G²,显著提升GUI智能体定位性能
在人工智能领域,GUI 智能体成技术风口,但现有 GUI Grounding 方法有缺陷。浙大团队提出 GUI - G²,将 GUI 交互转变为连续空间建模,在三个主流 GUI 定位基准测试中表现亮眼,重新定义了 GUI 交互本质。
4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦
香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。
不懂建模也能做角色!VAST升级AI神器,一手实测来了:一键拆建/魔法笔刷/万物绑骨
3D大模型明星初创公司VAST推出的Tripo Studio大升级,有智能部件分割、贴图魔法笔刷等四大核心功能,直击过去建模流程痛点,实现从“给模型”到“交成果”的质变,提升全链路效率。
7B参数比 Kimina 72B 版更强!DeepSeek 新模型将“自动化所有运算”?奥赛生实测能力“太棒”
阿里开源14B电影级视频模型!实测来了:免费可玩,单次生成时长可达分钟级
昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,可在通义万相官网免费体验,单次生成时长可达分钟级。
小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超
浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。