「图像自动着色模型」共找到 1015 篇相关文章
智能体「卷王」诞生!干活自动配结项报告,1.5张截图就把事说清了
在LLM/VLM驱动的智能体强化学习研究中,验证完成度是挑战。为此提出SmartSnap方法,让智能体成“质检员”,主动留痕存证。它有三大突破,表现惊艳,简化训练准备,让AI更可靠。
Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!
自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。
OpenClaw Skill × DuckDB:一个会自动进化的电商销售分析预测是怎么炼成的
文章介绍 OpenClaw Skill 系统,给 AI 操作手册让其做事,还引入 DuckDB 解决大数据分析慢问题。以电商销售分析预测为例,展示两者结合实现自动化数据分析迭代闭环,使模型预测更准。
图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理
华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。
让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench榜单第一
近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现端到端自动化。
传Claude sonnet 5即将发布:能自动组建开发团队,一人即一公司,价格爆降50%
小道消息称Anthropic下一代AI模型Claude Sonnet 5或于北美时间2月3号发布,代号“耳廓狐”。它有全新功能,能化身虚拟开发团队,编程能力强,价格将降50%,还与谷歌深度合作。
大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单
蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。
ICLR 2026 Oral|中科院团队提出新框架「SparseRL」,深度强化学习可自动生成高性能CUDA代码
中科院计算所团队提出 SparseRL 框架,将深度强化学习引入稀疏 CUDA 代码生成任务。实验显示,在 SpMV 任务上编译成功率提升 20%,执行速度提升 30%。该成果已入选 ICLR 2026 Oral。
继微软Playwright之后,谷歌Chrome DevTools MCP也来了(网站开发,AI 自动调试控制台错误)
继微软Playwright后,谷歌推出Chrome DevTools MCP,可让AI代理用上Chrome DevTools,能查DOM/CSS、跑JS等。文中给出多种使用提示词示例,还提供了安装方法链接。