写任务」共找到 2545 篇相关文章

算法论文8

SmartSearch:奖励驱动query精炼,让Agent中的RAG会“改错”

现有LLM搜索Agent忽视‘如何提问’致答案易出错。SmartSearch提出‘过程奖励+查询精炼’双机制,让Agent学会‘不好就改’,代码已开源。经实验,它在六数据集全面领先,各机制缺一不可。

PaperAgent
开源动态8

挖到 9 个 Claude Skills 宝藏开源项目,AI 能力直接拉满!

Claude Skills 热度高,作者梳理分享 9 个值得关注的开源项目。涵盖官方与生态合集、任务规划与技能探索、Agent 与工程化实践等类别,展示不同场景应用,助读者找适合项目。

开源先锋
算法论文8

4D通用世界模型!中科院NeoVerse用百万单目视频直接构建

中国科学院自动化研究所与CreateAI团队构建4D世界模型NeoVerse,它用全新端到端架构,从单目视频高效重建4D高斯泼溅,模拟成像退化提升生成鲁棒性,在多任务表现卓越。

AIGC开放社区
算法论文8

让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」

在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。

量子位
产品应用7

Hexstrike AI在多个工具及模型上的渗透测试表现

文章围绕Hexstrike AI在多个工具及模型上的渗透测试展开。介绍测试环境,用不同难度靶机测试。分析Claude desktop+Sonnet 4.5、AIaW+Deepseek、Cursor+多个模型等组合表现,指出LLM辅助渗透测试任重道远。

AI与安全
产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪
产品应用7

Claude code skills 怎么用来作?

作者成峰分享用Claude Code的Skills功能作的方法。先做作准备,再用Skills辅助作,介绍其优势、建立方法,最后排版发布。强调有效AI作是让AI执行方法论,形成闭环。

AI产品自由
产品应用8

AI Code赛道跑出一匹黑马:字节Doubao-Seed-Code

字节发布面向Agentic Coding任务优化的编程模型Doubao - Seed - Code。它在代码能力、生态兼容性、价格上优势明显,在实际案例中表现出色,其训练体系独特,为开发者提供高性价比选择。

PaperAgent
产品应用8

全球第二、国内第一!钉钉发布DeepResearch多智能体框架,已在真实企业部署

在数字经济浪潮中,企业对高效信息获取与决策支持需求迫切,但现有研究系统存在不足。阿里巴巴钉钉团队提出Dingtalk - DeepResearch多智能体框架,在评测中成绩优异,已在真实企业场景部署。

机器之心
开源动态8

上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体

上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。

机器之心