动态视觉伺服系统」共找到 994 篇相关文章

算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
算法论文8

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。

量子位
产品应用7

Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。

机器之心
算法论文8

PixelRefer :让AI从“看大图”走向“看懂每个对象”

多模态大模型多停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在多项任务表现领先,轻量版性能优,还开源两类数据集。

机器之心
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
开源动态8

百度Qianfan-VL开源,纯国产自研昆仑芯跑出世界一流

百度开源全新视觉理解模型Qianfan-VL,有3B、8B和70B三个版本,在昆仑芯P800芯片上训练。该模型多模态能力强,OCR和教育场景表现突出,跑分超国际主流模型。芯片功耗低、架构优,模型训练方法创新。

AIGC开放社区
产品应用7

Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓

Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。

量子位
产品应用7

Nano Banana Pro 一键极速分镜

Nano Banana Pro能通过一个提示生成叙事型九宫格分镜,用户可构思故事或修改已有故事,还能放大分镜、提示AI修改,该流程极大提升视觉叙事速度,文中还给出提示词示例及任务要求。

AI进修生
新闻资讯7

AI看不到的爱心,成了最棒的AI检测器。

作者以漂浮爱心图检测AI,Gemini 2.5 Pro、GPT - 5等模型均失败。又用噪点鹿视频测试,AI准确率为0%。原因是AI是空间王者、时间瞎子,无“共同命运法则”视觉系统,存在时间盲视。

数字生命卡兹克
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论