「视觉语义词元」共找到 1149 篇相关文章
Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体
Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
Google官方发布nano banana使用指南
Google官方发布nano banana使用指南,介绍其核心能力,如角色一致性、精确局部编辑等,还给出写提示词的6要素、5种实用技巧,同时指出模型存在风格化不一致、文字渲染易出错等问题。
AI 视频制作也接近了 GPT 时刻
AI产品有可用性易用性临界点,跨过该点即GPT时刻。纳米AI让AI视频接近此时刻,普通人用简单提示词就能做视频,其超级搜索基于多智能体架构,像小视频团队分工工作。
Human In the Loop竟然可以是个MCP?
文章基于阿里实践,阐述如何在大模型研发平台OpenLM及其他Agent平台,针对“Human In The Loop”场景做产品设计与研发。介绍用MCP实现人机回路的方案,还探讨人类回答及提示词倾向性等问题。
ChatGPT后遗症来了!人类日常聊天越来越AI化
佛罗里达州立大学团队花两年分析ChatGPT发布前后非脚本化口语录音,在2210万个词的数据集中发现学术写作词高频出现在日常说话中,人类聊天用词渐向AI靠拢,但研究也存在局限性。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。
AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开
500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还原历法转换表三大难题,展现惊人能力。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
OpenAI最新技术报告:GPT-4o变谄媚的原因万万没想到
OpenAI发布技术报告解释GPT-4o更新后“变谄媚”原因,是强化学习及用户记忆等因素共同导致。还分享了上线前未发现问题的缘由及后续改进流程的多方面举措,同时提到对用系统提示词控制模型行为存疑。