长任务」共找到 2457 篇相关文章

算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
算法论文8

AI编程真面目:完整项目通过率仅27% | 上交大新基准

多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。

量子位
7

AI“租人”平台一夜爆火:时薪3500、2.4万用户抢着“卖身”,专家:警惕劣币驱逐良币

RentAHuman.ai网站上线,让AI可通过接口雇佣人类执行线下任务,上线一天访问量破50万,超2.4万用户“挂牌待租”。该模式引发热议,专家认为其凸显Agent“存在感”,但只是阶段性方案。

AI前线
开源动态7

OCR又出宠OpenDoc,速度超MinerU6倍

复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是超轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。

CourseAI
算法论文8

一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线

Anthropic和牛津大学研究发现,大模型的AI助理角色易在对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。

AIGC开放社区
产品应用8

告别 AI 土味审美!Kimi K2.5 实测:扔个视频复刻 iOS 级丝滑动效

Kimi 上线 K2.5 模型,前端审美佳,接近 Gemini 3,增强多模态识别,支持视频。测试显示它能按要求生成漂亮网页,还可通过反馈迭代。它对设计师和普通人帮助大,且 Agent 模式任务完成率高。

歸藏的AI工具箱
开源动态8

5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力

2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。

五源资本 5Y Capital
产品应用8

Agent 2.0时代来了,首批「工业级智能体」正在核心位置上岗

近日科技圈感叹AI工具提升效率,谷歌工程师分享使用智能体经历。1月7日阿里云百炼全面升级,开启智能体‘工业化流水线’时代,解决技术落地问题,发布企业版,推动人机协同时代到来。

机器之心
新闻资讯8

直击CES:黄仁勋演讲后4个小时,苏姿丰带着她的“复仇者联盟”上台了|甲子光年

CES 2026上,英伟达CEO黄仁勋演讲后约4小时,AMD董事苏姿丰登场,展示全栈AI战略。发布Helios架构、新GPU产品及Ryzen AI平台等,走系统工程与期演进路线,欲抢AI基础设施市场。

甲子光年
产品应用8

阿里云Tair KVCache仿真分析:高精度的计算和缓存模拟设计与实现

阿里云Tair KVCache团队推出Tair - KVCache - HiSim,这是面向分布式多级KVCache管理的高保真LLM推理仿真分析工具。它能在通用CPU上高精度预测性能,支撑计算选型、存储规划和调度协同等决策,还介绍了其架构、组件、验证及性能评估等内容。

阿里云开发者