AI评测平台」共找到 10404 篇相关文章

新闻资讯7

黄仁勋129亿买下AI圈GitHub!Hugging Face守了10年的独立没了

英伟达黄仁勋宣布以129.303亿美元收购Hugging Face,这是英伟达史上最大整体收购。此前Hugging Face曾拒绝英伟达5亿美元入股,如今为求发展选择被收购。英伟达借此掌控开源AI分发,承诺平台开放,但开发者利益存变数。

新智元
新闻资讯7

OpenAI内部路线图精简纯享版

这是OpenAI内部路线图精简版,包含自动化AI研究员目标、五层安全策略、产品向平台AI云迈进等内容,还涉及算力投入、新公司结构、非营利组织资本部署及科学发现时间表。

AI寒武纪
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
产品应用7

C3仓库AI代码门禁通用实践:基于Qwen3-Coder+RAG的代码评审

本文介绍C3仓库基于Qwen3 - Coder+RAG的代码评审实践,在CI流水线监听代码修改触发AI评审,可发现逻辑风险、拦截高危缺陷。该实践能提升评审效率与质量,可复用于代码门禁平台或辅助编程工具,当前仍在持续优化。

阿里云开发者
新闻资讯7

AI 是否已经杀死了敏捷宣言

凯捷集团执行副总裁 Steve Jones 宣称“AI 已杀死敏捷宣言”,指出智能体 SDLC 与敏捷宣言存在根本性矛盾,业界反应不一,软件开发正进入方法论变革期,敏捷未来成谜。

InfoQ
产品应用7

一键搞定百万行Excel和PPT排版!这家杭州电力AI初创要给打工人减负

AI生产力革命被困云端,本地智能体工作台XMO - AgentBox应运而生。它由杭州曦谋决策打造,集成DeepSeek模型,能处理复杂场景,有平台化能力、核心价值,适合专业人士,现可免费下载桌面版。

量子位
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
新闻资讯7

谷歌新版Gemini马甲被扒! LMArena实测:唯一能看懂表的AI, GPT-5乱答

谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确看表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。

新智元
8

挺意外的,Agent长期记忆潜力被AMemGym挖出来了

论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。

PaperAgent
产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题

火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元