测试任务」共找到 3327 篇相关文章

新闻资讯8

「上下文工程」硅谷爆火,Karpathy亲自站台!提示工程瞬间失宠

继提示工程后,「上下文工程」在硅谷爆火,获Karpathy等大佬青睐。它是「全新的氛围编程」,是智能体成败关键。其范畴广,是科学也是艺术,为LLM构建上下文能解决定制任务

新智元
产品应用8

每一幕皆可控!字节发布多主体视频生成神器,人人皆主角

字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务

量子位
新闻资讯8

刚刚,OpenAI最强编程智能体上线ChatGPT

OpenAI宣布在ChatGPT中引入Codex研究预览版。它是云端软件工程智能体,能并行处理多项编程任务。自今日起,部分用户可使用,后续将推付费选项。目前处于早期开发阶段,未来计划推更灵活工作流。

机器之心
开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
开源动态8

首个长程Doc2Repo训练集!代码Agent不止修bug,开始造仓库

中国人民大学高瓴人工智能学院发布DeNovoSWE数据集,专注长程软件工程任务。它通过特定机制构造高质量数据,为代码智能体长程能力训练提供支持,实验显示能显著提升模型仓库生成能力。

新智元
产品应用7

豆包收费版第一天,我:充值…又得充值?我要再充值!

豆包开启付费模式,有三档收费标准,学生还有专属优惠。实测发现,付费版体验成熟,办公任务模式友好,但额度消耗快。文章还给出不同人群适合的档位建议。

量子位
产品应用8

Claude「永久大脑」,真的来了!

著名AI追踪平台TestingCatalog爆出,Anthropic正为Claude测试「双模记忆系统」,包括「经典记忆」和「文件记忆」。此外,「梦境」预览版亮相,还有终极Agent平台Claude Conway登场,7x24h永不下线。

新智元
新闻资讯7

让Agent真正“行动”起来,Agent Skill开发者大赛火热报名中!

人工智能下半场关键词是“行动”,Agent Skill成关键桥梁。Agent Skill开发者大赛今日启动,由AIGC开放社区与算泥社区联合主办,聚焦真实任务执行,设双赛道,官方提供支持,有丰厚奖励。

AIGC开放社区
新闻资讯7

谷歌智能体发力:增强版Gemini Deep Research和专属API都来了

OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。

量子位
算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。

AI工程化