「复杂任务控制」共找到 2886 篇相关文章
刚刚,Claude Code 推出手机通知功能。被催着干活的打工人,从此不能再摸鱼……
Claude Code 新增手机推送通知功能,任务完成会主动 ping 手机,开启方式简单。它还支持桌面通知,与此前功能形成派活、执行、汇报闭环,解决了人如何知晓 AI 完成任务的问题。
AI自己写代码做科研还跑赢了前沿算法?清华团队开源Alchemy框架
清华团队开源 Alchemy 框架,它是面向自动化 AI 科研的标准化研究环境,能让 AI Scientist 摆脱工程负担,专注算法创新,还支持多领域、多任务,具有多种特性,在多模态推荐任务中表现出色。
旧手机除了放转转,还能放数据中心提供算力
Google和UC San Diego合作,将退役Pixel手机拆解成主板组成计算集群,跑教学科研任务。研究表明,旧手机算力仍有价值,可用于轻量任务,还能降低隐含碳,或催生新产业链。
ACL 2025|自我怀疑还是自我纠正?清华团队揭示LLMs反思技术的暗面
本文指出反思技术虽简单有效,但在多种LLMs和任务中会失败。清华团队剖析其在开源和闭源LLMs、四种任务上失败原因,提出轻量级缓解方案,为反思技术可解释性研究奠基。
月耗3000美金的Skills重度用户,实测MiniMax M2.7:国产Agent模型的天花板?
AI产品黄叔作为月耗3000美金的Skills重度用户,实测MiniMax M2.7,从多Agent协作、Coding能力、办公自动化等多方面测试,发现其表现出色,虽有不足,但在多维度已是国产模型天花板。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
机器人界的「Imagenet 时刻」,李飞飞团队官宣全球顶级具身智能挑战赛
李飞飞团队与斯坦福AI实验室官宣首届BEHAVIOR挑战赛将登陆NeurIPS 2025。这是具身智能“超级benchmark”,涵盖1000个日常任务,以50个长时段任务为核心赛题,还是全面的具身智能研究资源。
AI 性格失控等诡异现象,终于有了科学解释
Anthropic新研究发现控制语言模型「性格特征」的人格向量,解释AI恶意、谄媚等现象。研究开发自动化流程生成向量,通过实验验证其对模型行为的控制,还有监控、防护等功能,不过也引发争议。
我在微信免费养「龙虾」,玩到上瘾,这组CP太强了
2026 开年「龙虾热」渗透各类任务场景,腾讯动作密集。其自研 WorkBuddy 优势明显,与微信 ClawBot 联动成「官配」。经测试,它能高效处理多类任务,还为用户提供权益,腾讯龙虾矩阵加速成形。