「Agent评测」共找到 3194 篇相关文章
腾讯版“Claude Code”来了!AI编程L4时代is coming
9月9日腾讯发布AI CLI工具CodeBuddy Code,CodeBuddy IDE开启公测。它是腾讯版“Claude Code”,可自然语言驱动开发运维。随着AI编程发展,CLI成基础设施,CodeBuddy代表企业级AI编程新方向。
对话逐际动力张巍:造机器人很容易,关键是用起来
量子位对话逐际动力创始人张巍,他表示人形机器人本体硬件制造容易,难点在大脑和小脑AI化能力。逐际动力要做技术平台,降低开发门槛,目标是让天下没有难落地的机器人。
OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!
半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。
给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案
现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。
一文读懂深度表格数据表示学习 | 南京大学
南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。
别再构建多智能体了
Multi Agent应用有望成大模型应用范式,但Cognition AI团队认为2025年追求多智能体并行协作架构是歧途,存在信息孤岛和决策冲突问题。主张采用单线程线性架构与上下文工程。
程序员从此不再写代码!红杉专访Codex团队,o3白菜价真相曝光
红杉专访OpenAI Codex团队,揭示AI编程未来。Codex从代码补全演化为智能体,强调委托心态,开发者从动手转向审核。还爆料OpenAI内部有递归自我改进的AI Alice。
AI大模型重塑学习硬件:从工具到伙伴 | 网易有道孟旭
在 AICon 全球人工智能开发与应用大会·上海站(2025)现场,网易有道孟旭以有道 AI 答疑笔为例,分享智能学习硬件变革逻辑,指出其进化是用户需求、硬件创新与 AI 技术螺旋推进,还探讨大模型应用及未来方向。
DeepSeek揭秘o1后,小红书似乎破解了o3的技术路线,还开源了~
OpenAI闭源后,大家不知其先进模型技术路线,解密成重要任务。DeepSeek R1年初开源后引发关注,小红书团队核心贡献的论文似破解o3谜题,还开源模型等,为训练调优提供可行路线。
OpenAI押注RSI,国产AI火速交卷!Flash叫板万亿大模型
OpenAI、Anthropic先后公开布局递归自我改进(RSI),国内云知声推出搭载RSI自迭代机制的U2-Flash大模型,本文带来实测表现与技术路径拆解,验证小激活规模对标万亿大模型的可行性。