编程Agent评测」共找到 3990 篇相关文章

产品应用8

手撕Sora,脚踢Veo!13个行业实战案例,Seedance 2.0玩法大全

本文是藏师傅对 Seedance 2.0 的测评和教学,介绍其 API 春节后将上线火山引擎,支持全模态输入。通过 13 个行业实战案例展示该模型能力,如生成广告、宣传片、教学视频等,还提及 Agent 自动化应用。

歸藏的AI工具箱
开源动态8

WAIC抢先爆料:金融“黑马”大模型超DeepSeek刷新SOTA,论文已上线

WAIC期间,蚂蚁数科金融推理大模型发布会未开,论文已上线。其新模型Agentar - Fin - R1有8B和32B版,在金融测评集超DeepSeek等,还兼顾专业与通用,蚂蚁数科还提出评测基准Finova。

量子位
推荐文章7

越靠经验思考的岗位,越先被取代!OpenHex董舒:AI数字员工正在催生OPC一人公司

OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。

AI科技大本营
产品应用7

Claude写完代码不直接交了:4个Skill自查一遍,改好再找你

Anthropic将AI验收纳入循环,让Claude写完代码后进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。

新智元
产品应用7

The Batch: 922 | 面向智能体的管理系统

OpenAI 发布 Frontier 平台,用于编排和管理企业级 AI 智能体团队。它支持智能体构建、信息共享等,Cisco 等已试点,未来将更广泛开放。与 Microsoft 的 Agent 365 有不同侧重,企业对智能体集中管理需求渐显。

DeeplearningAI
开源动态8

8B 端侧写作智能体 AgentCPM-Report 开源,DeepResearch 终于本地化

1月20日,8B端侧写作智能体AgentCPM - Report开源。它以端侧模型为核心,实现本地化部署与SOTA性能双重突破,亮点在于极致效能、本地安全保障,在多评测基准表现出色,部署便捷,两大创新支撑其优秀性能。

InfoQ
产品应用7

在微信中用 Google 登录,很难吗?

作者开发基于 LLM 的个性化实时快讯小工具,开发登录功能时发现微信里用 Google OAuth 登录失败,源于 Google 安全限制。众多产品有糟糕体验却未解决,作者用 Claude Code 轻松搞定,还分享 AI 编程观点。

AGI Hunt
新闻资讯8

写代码写出26亿身家、“淘宝第一个程序员”多隆离职后重出江湖,加入老同事创企,“杀入”AI赛道!

技术大牛多隆离开效力25年的阿里,于8月6日加入贝联珠贯,投身AI赛道。他曾是“淘宝第一个程序员”,一路走到阿里P11、成为合伙人,身家达26亿。此次他将和老同事毕玄用AI Agent改写运维服务格局。

AI科技大本营
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
算法论文7

AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab

上海人工智能实验室等团队设计REST框架,在一个prompt里抛多个问题模拟多任务推理场景。测试发现即便顶级模型如DeepSeek - R1在“高压”下准确率也骤降,该框架能揭示模型差异,为评测提供新范式。

量子位