「跨平台评测」共找到 2120 篇相关文章
桌面 Agent 的下一步:不是会操作,而是会调度工具
复旦大学和通义实验室提出 ToolCUA,让模型在 GUI 与工具调用间编排路径。它从已有 GUI 轨迹合成训练数据,设计奖励机制,在 OSWorld - MCP 评测中效率与准确率大幅提升,为 CUA 发展提供方向。
华为携手中科大发布灵境造物,openJiuwen首发Coordination Engineering全栈支撑
4月25日,中国科学技术大学发布“灵境造物”智能科研云平台,面向全球开放。华为支持的openJiuwen社区与MindSpore社区提供Coordination Engineering技术体系,让AI从“单兵作战”升级为“科研精锐团队”,适配科研全流程需求。
一个月狂揽2w+star,带你手搓自己的claude code!
Claude Code受广泛关注,但多数讨论抽象或为‘黑盒用法’。`learn-claude-code`项目对其深度拆解,通过12个课程教构建智能体载具系统,开源超一月揽34K star,还提供Web交互平台。
刚刚,国产视频模型登顶全球第一!给谷歌Veo上了一课,还把钱给挣了
国产视频生成模型SkyReels V4在第三方榜单中登顶全球第一,压过谷歌Veo 3.1等。它能力强大,解决视频AI老毛病,支撑昆仑万维短剧平台DramaWave,构建了完整AI生态闭环。
谷歌推出 Conductor:一款面向 Gemini CLI 的上下文驱动开发扩展
谷歌发布新的 Gemini CLI 预览扩展 Conductor,为 AI 辅助软件开发引入结构化、上下文驱动方法,解决跨会话丢失项目上下文问题。它将开发上下文存于持久 Markdown 文件,支持团队配置,还强调规划优先工作流。
Google Research 开源新架构,AI 不再依赖云端,直接跑在手表和耳机上
Google Research 开源 Coral NPU 平台,是面向硬件工程师与 AI 开发者的全栈开源方案,可克服 AI 在可穿戴和边缘设备落地的瓶颈,实现能耗与算力平衡,还能解决算力、生态、隐私等问题。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
智源研究院发布中英文高质量数据集CCI4.0,推动全球人工智能开源创新
2025年5月6日,智源研究院在全球开源创新论坛发布中英文高质量数据集CCI 4.0,同步在多平台开源。CCI 4.0规模大,处理严格,此前CCI系列反响好,未来将持续建设中文预训练语料库。
再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链
大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。
企鹅终于跟进了:OpenClaw 接入企微,一个企微群,我管住了 Win、Mac、手机,还能@不同AI 专家
微信不开放,企业微信却允许 OpenClaw 接入。其接入简单,还具特色机制与主动性通知。文中介绍了 OpenClaw + 企微等玩法,如多 Bot 群聊、跨设备控制等,最后给出企微接入 OpenClaw 保姆教程。