视觉任务」共找到 2423 篇相关文章

算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
开源动态7

Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集

Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务

InfoQ
产品应用8

Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了

Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,减少人类干预。该版本能力大幅增强,还引入新护栏机制保障安全,推出新运算级别和任务预算功能。

AIGC开放社区
新闻资讯7

两份报告,两种 PMF:ChatGPT 跑通了 Copilot,Claude 验证了 Agent

OpenAI和Anthropic发布核心产品使用报告,展现ChatGPT和Claude用户心智差异。ChatGPT像Advisor,以询问、写作为主;Claude似Agent,随模型能力提升,用户倾向用其执行自动化任务

Founder Park
新闻资讯8

刚刚,GPT-5.1发布,OpenAI开始拼情商

深夜,OpenAI上线GPT - 5.1 Instant和GPT - 5.1 Thinking模型。前者更温暖智能、指令执行强,后者处理任务更高效易理解,语气温暖。模型将逐步推出,还发布系统卡附录。

机器之心
新闻资讯7

关于GPT-6 Astra的三条判断|甲子光年

北京时间9月4日凌晨,OpenAI发布GPT-6 Astra,演示其多种能力。「甲子光年」判断:GUI没消亡,是软件兼容层;Astra会“吞噬”App入口;传统Benchmark难描述Agent,任务闭环成关键。

甲子光年
新闻资讯8

机械手成精了:能变形、能爬行、自己抓东西,全程无人操控

武汉大学高霄团队设计出可拆卸爬行机械手,能像普通机械手抓取物体,还能脱落爬行够取远处物品。其完成全套取物任务,未来有望用于工厂、救援、家庭等场景。

DeepTech深科技
新闻资讯7

Karpathy 教它的 nanochat 数单词里有几个“r”

Andrej Karpathy 教超小型语言模型 nanochat d32 数单词里字母 r 的数量,创建 SpellingBee 合成任务微调模型,虽像填鸭式教学但有效,不过小模型上下文处理能力有限。

AI工程化
推荐文章7

Qwen2.5VL新玩法,看电影讲故事

本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。

CourseAI
产品应用7

Qwen2.5VL又多一个娱乐场景,看电影讲故事

文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。

CourseAI