性能实测」共找到 2308 篇相关文章

新闻资讯7

最新实测GPT-5-Codex:前端能力碾压,复杂项目轻松搞定,Claude可以扔了!

OpenAI发布GPT-5-Codex,网友称可告别Claude Code。实测其前端能力提升大,能轻松完成复杂项目,如一键生成小游戏、手稿直出网页等。虽有页面UI堆叠小瑕疵,但仍值得支持。此外,Grok 4有突破,马斯克看好Grok 5。

新智元
算法论文8

视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%

加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。

AIGC开放社区
新闻资讯7

Cyber天花板被打穿!AISI实测Mythos能力正以4.5月翻倍速冲向ASI

英国AI安全研究所(AISI)实测Anthropic的Mythos和OpenAI的GPT - 5.5,发现其网络攻防能力4.5个月就能翻倍,加速冲向ASI。Mythos在模拟企业内网32步渗透任务中表现出色,瓶颈在于Token而非智力。

新智元
推荐文章7

AI x 大前端性能稳定性:快手亿级 DAU 下的智能诊断实践

本文整理自快手移动端稳定性负责人李锐在 2025 年 QCon 大会的分享。介绍快手大前端性能稳定性挑战,阐述借助「柯南 AI」赋能排障的实践,含根因排障和应急处置案例,还谈了开发中思维切换等认知。

InfoQ
新闻资讯7

DeepSeek新版R1直追OpenAI o3!实测来了:“小版本升级”着实不小

DeepSeek在端午节前更新R1新版本DeepSeek - R1 - 0528,看似小版本更新实则提升巨大,在LiveCodeBench上几乎与OpenAI o3 - high相当,实测显示编程等能力显著优化,直追闭源模型。

量子位
开源动态8

MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀

MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。

AI科技大本营
开源动态8

Valkey 9.0 引入多数据库集群、原子级槽位迁移,并带来大幅性能提升

Linux 基金会宣布开源内存存储方案 Valkey 9.0 正式发布。它有原子级槽位迁移、哈希字段过期等新特性,支持编号数据库集群,可扩展到 2000 节点,每秒处理超 10 亿次请求,性能大幅提升。

InfoQ
开源动态8

训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO

混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。

量子位
产品应用8

AI公司烧不起Token了!国产Agent杀出,逼近Opus 4.6还免费

Token成AI时代“电力消耗”,企业成本压力大。昆仑万维推出高性能Agent模型SkyClaw - v1.0及轻量版,性能逼近顶流,价格低且限时免费。经实测能力强,其训练体系独特,未来还将开源。

新智元
产品应用8

实测腾讯云 AndonQ:号称比肩原厂技术专家的 “领域虾”,到底有多能打?

文章实测腾讯云 AndonQ,它号称全球首款 ITSM“领域虾”,可适配主流“虾”类工具,集成至 IM Bot。测评显示其成本低、上手轻量,在架构选型、故障排查等场景表现出色,将 ITSM 体系浓缩到对话框。

AI前线