「科技评价体系」共找到 1517 篇相关文章
内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!
OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能体系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。
从 MCP 到 Agent:构建可扩展的 AI 开发生态的工程实践
本文整理自字节跳动 Trae 架构师陈仲寅在 AICon 2025 上海的分享。探讨通过 MCP 及 Agent 构建可扩展生态体系,涵盖自定义 Agent 设计、与工具集成及共建等内容,还展望技术演进方向与 AICon 深圳站信息。
深度解读|LLM Wiki 的工程实践,从 AI Coding、Obsidian 到 RAG 协同。
文章介绍 LLM Wiki 工程实践。包括为 AI Coding 创建知识地图,指导 Agent 加载上下文;在 Obsidian 构建知识体系,有插件和自定义 Agent 两种方法;还分析其与 RAG 关系,指出可融合互补,不要过度神话 LLM Wiki。
从卖token到卖结果,这些公司开始让AI背KPI了
当前企业难以衡量AI真实价值,常以调用量代替产出。一批公司开始尝试改写,如Sierra和零犀科技,直接对结果收费。Sierra覆盖超40%财富50强企业,零犀实现规模化盈利与正现金流。
一个“上天”,一个“要脸”:他们正颠覆你对机器人的想象 |5Y View
五源合伙人孟醒对话微分智飞高飞、首形科技胡宇航。高飞要为飞行终端造‘具身大脑’,胡宇航给机器人一张能传情的脸。他们没走主流赛道,是顶尖科学家创业,也是让机器人进化的尝试。
1.2K Star!终于有工具开始认真解决 AI Agent 安全问题了!
作者深度使用AI Agent时担忧其安全性,GitHub上斗象科技开源的ClawVault项目,上线不久获1.2K Star。它为AI Agent提供多场景安全隔离方案,有分格管理、可视化监控等实用设计,适配Python3.10+环境,安装方便。
垂直赛道 Agent 闷声发财指南:如何实现一年超千万营收?
本文围绕垂直赛道的2B Agent展开,分享了语核科技创始人的产品理念与经验,探讨了如何找到有价值的场景、构建高价值闭环。还介绍了客户的应用情况、对Agent的看法及选型考量,强调其商业价值与落地挑战。
Devin CEO:别搞多智能体!Anthropic:我们性能提升90%!
最近,开发Devin的Cognition CEO发文称不要构建多智能体系统,而Anthropic分享构建多智能体研究系统,性能提升90%。Cognition认为多智能体协同难,坚持单线程线性Agent;Anthropic用工程设计绕开瓶颈。二者因任务类型不同观点有别。
GPT-4V仅达Level-2?全球首个多模态通才段位排行榜发布,General-Level打造多模态通用AI评测新范式
General-Level团队提出全新评测框架General-Level和数据集General-Bench,构建超大规模评测基准和多模态通才模型排行榜。其用五级段位体系衡量模型通才能力,General-Bench覆盖多模态任务,排行榜分多层次榜单,目前各模型段位差异大,Level-5空缺。
100亿美元!AI时代最闷声发财的两家公司,要合并了
《华尔街日报》报道,支付公司Stripe正与AI初创公司OpenRouter谈判收购事宜,价格达100亿美元。OpenRouter是全球规模最大的AI模型聚合平台,Stripe为科技公司提供底层金融服务。此次收购将扩展Stripe业务至AI生态。