「纯视觉感知」共找到 994 篇相关文章
清华许华哲:具身智能需要从 ImageNet 做起吗?
清华许华哲探讨具身智能,分析其爆发原因、失败模式及决策点,涉及视觉信号输入、触觉应用、学习方法等,还探讨具身智能是否需‘ImageNet时刻’,并从宏观视角谈智能的共性。
上手“设计界的Manus”,朱啸虎点赞,Lovart这波魔法破圈了丨TIP 002
国产出海产品Lovart被称为“设计界的Manus”,获朱啸虎点赞。它是设计领域首个Agent,能用自然语言驱动生成多模态视觉作品,可生成VI体系、短片等,适合文创领域,还能人工编辑,调用多模型。
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。
DESIGN.md:又一个你必须知道的Markdown文件
Google Stitch推出DESIGN.md,这是一个纯文本设计系统文档,放项目根目录,AI助手能直接读取生成一致UI。它含基础设计规范,有9个核心部分。还有现成设计系统库,HyperDesign可自动生成该文件。
0行人类代码!OpenAI内部绝密实验曝光:3人团队5个月砸出百万行级产品
OpenAI工程团队进行内部实验,构建并发布零人类代码的内部软件产品,代码全由Codex智能体编写。团队分享开发经验,如重新定义工程师角色、让应用对智能体可见等,还面临一些未知挑战。
模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!
多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。
阿里千问你别太荒谬!连漫画PPT都能一键生成?我以前那些夜真是白熬了
阿里千问发布AI PPT生成工具Qwen AI Slides,从内容结构到视觉配图全包。实测显示,其语义理解能力不错,文本渲染在简单字体表现好,排版有小瑕疵,适合课堂展示等场景。
对话原力灵机周而进:模型2.4B就够用,关键是“具身原生”;能闭环才是最高效方法
原力灵机推出首个具身原生模型产品DM0,仅2.4B参数,却能支撑实时处理画面与真机进化。其合伙人周而进称要走具身原生路线,还介绍了数据采集、模型训练等多方面内容及公司发展规划。