「音视频处理」共找到 1879 篇相关文章
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。
Agent 正在终结云计算“流水线”,Infra 必须学会“思考” | 专访无问芯穹夏立雪
InfoQ 专访无问芯穹联合创始人夏立雪,他分享了面向 Agent 的基础设施建设进展与经验,探讨从“处理”到“思考”的范式转变对基础设施的冲击,指出 Agent 规模化落地阻碍及解决办法,还谈及 Agentic Infra 等内容。
Telegram创始人搞了个狠活:100%隐私的去中心化AI网络
Telegram创始人帕维尔·杜罗夫推出专注机密AI计算的去中心化网络Cocoon,或终结中间商垄断。它基于TON区块链,有三层架构,四步完成AI查询,但面临延迟和竞争挑战,未来将采用DAO治理。
Nano Banana Pro最全解析,设计师和开发者都用得上,附官方提示指南
Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理能力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间。
真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅
美国具身智能创业公司PI发布最新机器人基础模型π*0.6,新方法大幅提升具身智能成功率与处理效率。其开发的Recap方法从经验数据获训练信号,使模型能执行多项真实世界应用。
谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场
Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
OpenAI引爆新赛道:AI不再卖技术,而是卖「活人感」!
一段小女孩与AI玩具深情告别的视频走红,揭示对话式AI融入人类情感世界。声网Convo AI&RTE 2025大会指出对话式AI将成下一代AI Infra重要部分,情感陪伴、智能硬件、在线教育将率先规模化落地。
超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦
中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。
知名机器人专家喊话:投人形机器人初创公司的数十亿美元,正在打水漂
知名机器人专家罗德尼・布鲁克斯质疑特斯拉、Figure等公司技术路线,称让机器人看人类视频学操作是‘空想’。他指出触觉数据无技术积累、安全有隐患,预测成功‘人形’机器人未来将大不同,投资难量产。