「性能实测」共找到 2337 篇相关文章
Agent与工具交互平台级探索,只用接入一个MCP服务就能调用6000+工具
在模型性能趋同背景下,知识库、工具成AI应用差异壁垒。MCP规范Agent与工具交互,但在实际生产中有挑战。ACI.dev项目维护者Aipotheosis Labs探索简化Agent与外部工具集成等过程,对企业级应用有示范意义。
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩
《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。
刚刚,Top级的视频AI免费了!我反手做了个精致版《牛来》
明星AI实验室Agnes发布的Agnes Video 2.5系列已上线Pavo创作平台。其中,Agnes Video 2.5 Flash免费,适合AI短剧创作者;Agnes Video 2.5每天送积分,适合商业场景。实测显示其效果佳,免费还能大胆试错。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨
DeepSeek官方邮件称7月上线V4正式版,高峰时段API各类token价格翻倍,但其他时段仍维持低价。此前它一直以低价著称,此次涨价或与算力紧张、自建数据中心有关,且更新将带来功能优化和性能提升。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。
龙虾创始人深夜点赞:百度 DuMate,打工人的 AI 搭子
文章介绍百度新上线的产品 DuMate,它被定位为首个「国产企业级满血版 OpenClaw」。安装简单,能深度集成百度工具生态,部署方便且安全。通过多场景实测,其任务完成度高,是打工人实用的 AI 搭子。
阿里开源Qwen3-Coder-Next,80B参数仅激活3B的MoE顶尖编程助手
阿里开源小型MoE代码模型Qwen3 - Coder - Next,总参数量800亿但仅激活30亿参数,在代码生成等任务表现出色。团队构建训练技术栈解决数据匮乏,模型训练分阶段,多领域专家模型能力整合,基准测试性能强劲。
全球最强AI音乐模型,现在来自中国!高晓松也来围观了
昆仑天工发布音乐模型Mureka V8,实测打败硅谷Suno V5成世界第一。它能生成完整可发布歌曲,结合MusiCoT技术实现从“能生成”到“能发布”跨越。高晓松等认可其变革潜力,昆仑天工联合太合音乐打通产业链。