「Agent任务」共找到 4249 篇相关文章

开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
算法论文8

腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合

日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。

InfoQ
推荐文章8

吴恩达来信:AI 速度带来的价值被低估了

吴恩达指出,AI 不仅能降低任务执行成本,还能显著加快执行速度,其在创造商业价值方面的重要性常被低估。以编写代码、借贷审批等为例,说明提速能带来新价值,企业应关注可提速环节带动增长。

DeeplearningAI
产品应用9

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

本文深度解读DeepSeek最新发布的V4.1 Flash大模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新大幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。

AI科技评论
开源动态8

ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律

openJiuwen社区的ScienceDiscovery把科研试错交给程序,通过树搜索实现科研场景产物RSI。它能在多个案例中高效产出成果,成本低、耗时短,且底座灵活,可换算法和任务,但推广需解决验证速度和可信度问题。

量子位
开源动态8

本地Opus你要不要!Qwen3.8-27B开源

阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。

AIGC开放社区
产品应用8

RoboScience机器科学发布轮式仿人形通用机器人REX G1,让机器人真正成为新一代具身生产力伙伴|甲子光年

8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1,搭载自研的Visics通用具身大模型,面向多场景打造,能完成完整任务闭环。它将移动与操作融合,适应真实环境,具强大泛化能力且续航佳。

甲子光年
新闻资讯7

Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车

Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。

AI科技评论
新闻资讯7

Sonnet 5 翻车!同性能价差最高 56倍,海外巨头为何复刻不出 DeepSeek?

Anthropic发布Claude Sonnet 5,官方称补足了Agent能力,价格优惠,但开发者反应不佳。Sonnet 5因tokenizer换代,实际使用成本更高,且比同类模型贵。与之相比,DeepSeek V4 Pro便宜很多,其靠技术实现低价,海外厂商难以复刻。

鲸选AI
产品应用7

亚马逊云科技 AI 助手终于来了,一出手就对标 Cowork

亚马逊云科技推出 AI 助手 Amazon Quick,对标 Claude Cowork。它是 AI 驱动的桌面办公助手,可通过自然语言完成多项办公任务,还能连接多种办公工具,在国内使用体验好,体现了 AI 办公从‘工具增强’走向‘流程重构’。

MacTalk