「性能实测」共找到 2308 篇相关文章
同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生全模态文心5.0
2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生全模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。
太炸裂了!全网实测Nano Banana Pro,网友:这模型里到底装了什么鬼东西!
谷歌Nano Banana Pro出世引发全网关注,它又名Gemini 3 Pro Image,整合多模态理解能力与知识库。普通用户可在Gemini应用免费体验,实测显示其实力强悍,还在网友手中玩出花,谷歌CEO也站台。
腾讯「鹅虾」紧急上线!一手实测:养虾门槛归零,QQ飞书钉钉全能接
腾讯昨日上线两个「鹅虾」产品,WorkBuddy是能接入多平台的智能体桌面平台,QClaw预计下周公测,可接入微信。作者实测WorkBuddy,考察其生态接入、代码开发等场景表现,还介绍了QClaw特点及腾讯云轻量应用服务器。
人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!
上海交大开源端侧Agent全栈工具链MobiAgent,将构建手机Agent全流程开放。它在真实场景性能超GPT - 5,还设计“潜记忆加速器”,通过三步养成Agent,评测表现出色,降低移动智能体开发门槛。
DeepSeek有点含蓄了,实测V3.1有进步,编程等个别场景硬刚GPT-5
DeepSeek悄悄更新V3.1,官方仅提及上下文长度拓展至128K。实测其代码能力与前端审美提升,逻辑推理也有进步,在编程等个别场景能硬刚GPT - 5,但处理复杂任务还有距离,更新不大却有进步且降价。
Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0
作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包大模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强大的自主纠错和多任务处理能力,也指出了不足。
推理速度10倍提升,蚂蚁集团开源业内首个高性能扩散语言模型推理框架dInfer
近日,蚂蚁集团开源业界首个高性能扩散语言模型推理框架 dInfer,在基准测试中,其将 dLLM 推理速度较 Fast - dLLM 提升 10 倍以上,攻克推理瓶颈,为开发者提供高效框架,推动扩散语言模型走向成熟。
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。
ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了
Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。
OpenAI携手五巨头开源革命性超算协议:一举解决超大集群LLM训练不稳定和网络性能难题
OpenAI联合英伟达等五巨头推出超算开放网络协议MRC并正式向行业开放。MRC目标是性能可预期,有多平面网络、自适应包喷射、SRv6源路由三大核心机制,已在OpenAI多台超级计算机上部署。