多任务操作」共找到 5615 篇相关文章

新闻资讯7

“Claude Code更新废了”!热议Issue:思考深度下降67%,已无法胜任复杂的工程任务

AMD的Stella Laurenzo分析发现,Claude Code某次更新后思考深度降67%,无法胜任复杂工程任务,行为走样。团队回应redact - thinking是UI改动,2月两项改动或有影响,但网友并不买账。

量子位
开源动态8

大模型结构化推理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一

个机构研究人员联合发布全新语言法律推理基准数据集LEXam,它含4886道题,每道长篇题有答案和推理路径。研究显示现有大模型应对法律推理难,LEXam引入评估新模式,还对不同模型做了测试。

量子位
产品应用8

4K-Agent:可将低分辨率图像提升至4K高清智能体

图像超分辨率技术在种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其智能体架构能将低分辨率图像提至4K高清,在领域测试表现出色。

AIGC开放社区
算法论文8

任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B

现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。

量子位
算法论文8

EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力

论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在任务实验验证其有效,揭示语言机制规律。

深度学习自然语言处理
新闻资讯7

GPT-5.6 Sol首批内测结果来了!同任务成本只有Fable 5一半

GPT-5.6 Sol预览版发布半月,首批内测报告出炉。它代码简洁,适合长链路任务,视觉效果好。虽整体略逊Fable 5,但成本近乎减半,且安全限制小,即将全量上线。

量子位
算法论文7

AIAAJ | 西工大张巧、张伟伟等:专家特征融合网络架构预测跨声速抖振气动噪声

为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。

力学与人工智能
推荐文章7

百度AI+ DeepSeek 豆包等GEO怎么做出排名?5个技巧,附快排与白帽操作区别

文章介绍GEO优化在AI大模型2 - 3天出排名的5个技巧,包括官网SEO梳理、词库挖掘整理、内容数据投喂、市场竞对分析和技术策略微调,还对比快排与白帽GEO服务商,强调合规操作

白杨SEO优化教程
推荐文章7

取消AI考核、零裁员!股价暴跌82%后,邻国走出了一条反硅谷之路

邻国曾是AI转型标杆,后股价暴跌82%。其联合创始人兼CEO Luis von Ahn在访谈中称未裁员,还分享公司用AI情况,如取消AI考核、员工用AI做课程等,也谈到了AI局限和各职业前景。

InfoQ
新闻资讯7

Anthropic智能体大会:Agent也会精神分裂,我们发现了Agent协作的本质解法。

Anthropic开发者大会聚焦Agent,分享智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。

探索AGI