「纯视觉任务」共找到 2505 篇相关文章
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
零GPU,世界第一超算!深圳制造改写游戏规则了
中山大学教授带队、深圳制造的灵晟超算登顶全球超算TOP500榜单,零GPU采用纯CPU架构,全链路自研。图灵奖得主评价其为“AI4S新型架构的希望之光”,还在多领域展开应用。
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动
宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。
BettaFish微舆:一个多智能体舆情分析系统
BettaFish微舆可依自然语言需求抓取分析30多个主流社交媒体生成舆情报告。它将任务拆解给不同智能体,系统架构清晰,最终整合生成带时间线分析的HTML报告。项目在GitHub开源且登顶趋势榜第一。
Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍
Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理
现有视频虚拟试衣方法受限于固定相机视角,难以满足用户自由观察需求。本文提出 TryOnCrafter 框架,定义可控相机视频虚拟试衣任务,引入可渲染 4D 试衣代理,支持多种下游应用,为虚拟试衣开辟新路径。
LangChain 创始人警告:2026 成为“Agent 工程”分水岭,传统软件公司的生存考验开始了
LangChain 创始人 Harrison Chase 认为 2025 年末到 2026 年长任务 Agent 落地会加速,传统软件公司面临挑战。他指出构建 Agent 工程范式在变,还分享了 Agent 应用案例、harness 工程要点、开发与传统软件的差异等内容。
蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了
蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据集,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。