动态视觉伺服」共找到 994 篇相关文章

7

突然变强!速度翻4倍,GPT Pro惊现「神级」操作,网友怀疑GPT-5.5已就位

OpenAI悄悄完成GPT Pro模型升级,其速度提升、视觉理解能力增强。同时,代号「Spud」的GPT - 5.5已完成预训练,发布在即,AI竞争将更激烈。

新智元
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
产品应用7

分享10个你可能不知道的Claude Code隐藏命令。

作者分享10个Claude Code隐藏命令,如/btw可并行提问不污染上下文,/rewind能分别回退代码和对话等,还介绍快捷键,强调Claude Code更新快,建议关注更新动态

数字生命卡兹克
算法论文8

Tokenization谢幕?H-Net登场:Mamba作者新作正面硬刚Transformer

「Mamba」作者之一Albert Gu在新Paper提出新技术,实现动态分块机制,嵌入H - Net可替代传统流水线。在多方面实验中,H - Net性能优于基于BPE token的Transformer模型。

PaperAgent
推荐文章7

Qwen2.5VL新玩法,看电影讲故事

本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。

CourseAI
产品应用7

Qwen2.5VL又多一个娱乐场景,看电影讲故事

文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。

CourseAI
新闻资讯7

GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘

OpenAI工程师在GitHub仓库意外泄露GPT - 5.4,相关信息流传后被撤回。据传下周上线,其有200万Tokens上下文窗口与持久记忆,支持全分辨率视觉直读,将引发硬件内存之战。

新智元
推荐文章7

Cursor AI 上下文管理的秘诀

Cursor发表《Dynamic context discovery》文章,讲述上下文管理秘密,提出“动态上下文发现”模式,分享五个优化手段,如长输出变文件、聊天历史变档案等,还阐述了为何用“文件”及相关思考。

宝玉AI
算法论文8

为什么自监督永远学不到语义?

《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。

深度学习自然语言处理
算法论文8

AI 如何讲好一个多人故事?首个支持多角色互动的3D场景叙事系统

首尔国立大学提出全新框架,能生成虚拟动态场景并支持多角色上下文动作生成。引入LLM拆解复杂任务,系统用事件驱动方式规划动作,还构建基准评估相关能力,有良好扩展性和实用性。

带你学AI