「Strands Agents V1.0」共找到 4816 篇相关文章
击败Meta登榜首:推理增强的文档排序模型ReasonRank来了
本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。
竞购 Chrome,正面竞争 OpenAI,Perplexity 为什么要做 AI 浏览器?
今年 Perplexity 推出 AI 原生浏览器 Comet,OpenAI 也计划发布浏览器,Perplexity 还出价 345 亿美元收购 Chrome。文章梳理了 Perplexity CEO 观点及 a16z 测评,介绍 Comet 特点、目标、优势,还对比了 Comet 与 Dia。
闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了
谷歌发起首届大模型国际象棋对抗赛,为期三天。参赛模型众多,首轮中 Gemini 2.5 Pro、o4 - mini、Grok 4 和 o3 以 4 - 0 战绩晋级半决赛,DeepSeek、Kimi 首轮被淘汰,目前 Grok 4 是夺冠热门。
万人见证,“出轨”CEO被停职;陶哲轩评“OpenAI内部实验模型获IMO金牌”;传字节Seed视觉负责人“暂休”|AI周报
这是一篇AI行业周报,涵盖多领域热点。如Manus季逸超复盘Agent研发经验;陶哲轩评OpenAI模型获IMO金牌;字节跳动绩效改革、人员变动;还有企业动态,像英伟达黄仁勋访华、宇树科技开启上市辅导等。
英伟达GPU被曝严重漏洞,致模型准确率暴跌99.9%
英伟达GPU被白帽黑客发现严重漏洞,通过GPUHammer攻击可使大模型准确率从80%降至0.02%。此攻击属Rowhammer类,直接对显存“物理动手”。英伟达建议的防御措施会使模型性能下降。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
钉钉上跑出的第一个行业专属大模型落地:准确率超 90% 的妇科专业大模型
近日,壹生检康在钉钉企业专属 AI 平台训练出“豆蔻妇科大模型”,准确率达 90.2%。钉钉构建支持体系助企业构建大模型,后续还将帮伙伴构建模型和智能体,服务中小企业。
弃 Python 拥抱 JVM,Spring 之父 20 年后再造“革命性框架”:我从未如此确信一个新项目的必要性
Spring 之父 Rod Johnson 开源专为 JVM 生态设计的 AI 智能体框架 Embabel,旨在弥合生成式 AI 的‘承诺’与‘现实’差距。它采用 GOAP 方法保证确定性,有弹性执行与动态重规划能力,还引入多种机制确保可控性与安全性。
谷歌MCP Toolbox for Databases拆解:助你快速构建数据访问智能体的神器
企业Agent运行常需访问数据库,但会遇到工程问题。本文详解谷歌开源项目MCP Toolbox for Databases,介绍其概念、好处、使用方式,还展示安装、配置、启动过程及不同模式下使用方法,兼具安全管控与可观测性。
苏妈联手OpenAI,AMD发布3nm怪兽MI355X,性能碾压英伟达B200!
AI芯片战争白热化,AMD在大会发布3nm工艺的MI355X,推理性能超英伟达B200,还公布明年推出的MI400系列等新品。OpenAI CEO称将用AMD芯片,AMD与OpenAI开启合作。