「家电操作评测」共找到 1194 篇相关文章
通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA
WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。
给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案
现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。
kimi 的RL end2end ON LLM
文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。
一文读懂深度表格数据表示学习 | 南京大学
南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。
狂赚 21.6K star!超牛的Cursor免费平替项目,隐私友好、功能超强,真的香!
开源君分享了开源AI代码编辑器Void,它是基于VS Code魔改的「开源版Cursor」,保留VS Code优点,AI辅助编码出色。在Github获21.6K star,有隐私保护等特色,操作简单易上手。
功能全面的Agent!吸取了open-manus,langmanus众家之长
Cooragent是在langmanus基础上重大改进的Agent框架。文章介绍其本地部署、CLI工具使用、添加MCP服务等实战操作,还提及深度兼容Langchain工具链、支持MCP等特点,有两种工作模式。
OpenAI Astra发布在即,全自动网络攻防能力已突破天际!
OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。
不做手机缩小版:AI 健康记录迁到手腕,要跨过哪些工程鸿沟?
文章聚焦HarmonyOS穿戴应用,如「小卡健康」将健康记录入口移到手表,还介绍「开练」「凯格尔运动」应用。阐述了从接口到产品需解决权限、断连等问题,强调要为用户提供合适体验。
马斯克4000亿布局Agent :杀死 Cursor,Bot 有什么绝招?
马斯克花600亿美金买下AI编程产品Cursor俩月后,SpaceXAI发布Grok Bot。它定位特殊、可跨应用操作等,亮点是多智能体云端协作,但产品力与生态有差距,定价高端。
阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航
阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。