「专家级表现」共找到 3410 篇相关文章
谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草
大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。
4 万星开源项目被指造假!MemGPT 作者开撕 Mem0:为营销随便造数据,净搞没有意义的测试!
高人气开源智能体记忆项目 Mem0 发布论文,称在 LOCOMO 测试打败对手。MemGPT 创始团队 Letta AI 联合创始人公开指控其造假,称测试无意义,自己轻松超其基准数据。二者都为解决大模型长期记忆问题而诞生。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
苹果分享 iOS 26 即将推出的 AI 基础模型的细节
苹果在技术报告中公布 iOS 26 新 AI 基础模型细节。该模型有 3B 参数和更大版本,前者在设备运行,后者用于私有云平台。介绍了架构、评估结果,还强调实现可信赖 AI 的方法。
推理路径的动态调控:让大模型学会“恰到好处”的思考
当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。
X-Actor 惊艳登场!长时唇动+情感同步人像动画生成
字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。
爆冷!首届大模型争霸,Grok 4下出「神之一手」?DeepSeek、Kimi惨遭淘汰
谷歌Kaggle举办首届全球AI象棋争霸赛,八款顶级语言模型正面对抗。首战8进4淘汰战中,Gemini 2.5 Pro、o4 - mini、Grok 4、o3晋级,Claude 4 Opus、DeepSeek R1、Gemini 2.5 Flash和Kimi K2出局。比赛考验AI整体理解能力。
告别复杂提示词!蚂蚁新方式让AI自动理解你的个性化需求
蚂蚁通用人工智能研究中心自然语言处理实验室提出AlignXplore方法,通过强化学习让AI从用户行为归纳偏好并动态更新。该方法训练分两阶段,支持流式偏好推断,实验表现优异,是大模型个性化新尝试。
ScreenCoder:视觉-代码对齐新范式,为多模态程序合成开辟道路
前端开发中UI转代码耗时易错,现有工具存在不足。ScreenCoder提出模块化多智能体框架,通过三阶段分工协作实现代码生成,还构建数据引擎推动VLMs进化,实验表现出色,为多模态程序合成开辟道路。