「实测」共找到 449 篇相关文章
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。
杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA
172天后,Kimi推出全新Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。
GPT-5.2发布即降智?背后华人被挖出,清北校友核心贡献
OpenAI发布GPT - 5.2,官方称其基准测试碾压Gemini 3 Pro,擅长完成有经济价值任务。但发布后实测有翻车情况,也有提前测试者称其很强。此外,背后多位核心贡献者为华人,如北大校友Yu Bai等。
刚刚,OpenAI开源2个推理模型:笔记本/手机就能跑,性能接近o4-mini
OpenAI深夜开源gpt-oss-120b和gpt-oss-20b推理模型,距上次开源已6年。模型亮点多,性能强,在多方面表现超专有模型。官方还放实测视频,展示其使用效果,同时解释了开源原因。
AI Agent的未来之争:任务规划,该由人主导还是AI自主?——阿里云RDS AI助手的最佳实践
文章以阿里云RDS AI助手实践为例,探讨AI Agent任务规划该由人主导还是AI自主。实测发现大模型自主规划效果不佳,企业更需稳定可靠,人工规划是最佳选择,还提出用‘混合规划’兼顾灵活与可靠。
P图老本事搭上了对话框,美图这AI Agent到底香不香?
本文对美图AI Agent RoboNeo进行实测。它web端操作简单,生图和p图功能丰富,拆分图层功能好用,工作流能辅助创作。不过它生成速度慢,视频生成有画面逻辑、文字生成等问题。其开发节奏快。
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
神秘模型「牛来」真身曝光,是智谱刚开源的 GLM - 5.3 Flash,为 5 系列首个原生多模态模型。它尺寸小能力强、价格低,用国产卡,实测多模态和 Coding 能力出色,架构全新,开源后将模型、算力和生态结合。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
拍我AI V5模型发布,AI视频的“不可能三角”被解开了?
拍我AI推出V5模型,一上架就到Artificial Analysis榜单前列。它在多维度升级,维持速度和性价比优势,试图解开AI视频生成“不可能三角”。文章实测其运动、二次元、商业等场景表现,还提及速度与价格优势。
Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账
Meta推出新模型Muse Spark 1.3,在Artificial Analysis榜单中与Fable 5打平手。小扎称其在Coding和Agent工作有大幅提升,还便宜。网友实测它真能肝、真能省,Meta团队核心研究员也透露背后改动。