「多语言视觉问答」共找到 1663 篇相关文章
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
LeCun出手,造出视频世界模型,挑战英伟达COSMOS
训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。
any-llm:又一个统一模型服务接口的Python代理库
Mozilla AI开发的开源项目any-llm,解决多LLM提供商接口统一问题,能让开发者用一个接口调用不同大语言模型。它吸取此前产品长处,有统一接口等优势,使用和安装简单。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI
上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。
让 AI 推荐美食,字节悄咪咪上线“AI 版美团”
字节跳动悄然上线AI产品「探饭」,可在抖音小程序体验。它能智能推荐美食餐厅,有AI问答、评价总结、点菜等功能,餐厅信息全,支持团购和外卖,还能比店PK。
The Batch:833 | 针对智能体的钓鱼攻击
研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。
时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8
在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。
大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一
传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。
提示工程实战指南:从Zero-Shot到Graph Prompting,7大核心技术全解析
随着大型语言模型发展,提示工程成关键技能。文章介绍零样本提示、少样本提示等七种提示优化模式,分析适用场景、优缺点,还给出示例,最后总结各技术适用场景及最佳实践。