智翼解决方案」共找到 3049 篇相关文章

开源动态8

数字人视频革命!MultiTalk开源:15秒多人对话一键生成,歌唱/卡通全驾驭!

在AI驱动的视频生成领域,创建多人对话场景是难题。MultiTalk是开源音频驱动多人对话视频生成框架,由MeiGen - AI等联合研发,输入多路音频等就能生成嘴型同步的视频,适用于多种场景。

开源星探
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
新闻资讯7

奥特曼之后,库克也哭晕在厕所?Meta疯狂砸钱,苹果AI核心要被连锅端!

苹果2名前AI专家Mark Lee和Tom Gunter会师Meta。扎克伯格亲自挂帅补AI人才与算力短板,加大投入力求跟上对手。苹果深陷人事动荡,Meta高薪挖人,苹果虽加薪但差距大。

新智元
算法论文8

演讲生成黑科技,PresentAgent从文本到演讲视频

联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。

机器之心
算法论文8

MSSP | 西北工业大学马启悦,高传强等:融合激波位置的跨声速抖振气动载荷辨识

本文提出融合激波位置的跨声速抖振气动载荷辨识方法,从时序流场提取激波特征,用稀疏辨识构建参数化代数方程,增强预测精度与泛化能力,为准确预测跨声速气动载荷提供新思路。

力学与人工智能
8

4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25

扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。

新智元
算法论文8

用子模优化法为DeepResearch生成多样性查询

开发DeepResearch时,生成多样化查询是关键。多数开源项目处理方法粗放,本文提出结合句向量与子模优化的方法,设计子模目标函数,给出代码实现,实验显示该方法生成的查询组合多样性更高。

Jina AI
推荐文章7

99%的人都不知道:MCP 必须在 Claude Code 外面装

作者分享飞书MCP安装经验,指出MCP要在Claude Code外安装,介绍用Cursor生成安装命令、验证安装、删除服务等技巧,还整理《MCP安装指令文档》,复制粘贴就能用。

AI 产品自由
算法论文8

字节Seed提出序贯策略优化方法,突破同传“质量-延迟”权衡问题

AI字幕质量和延迟难平衡是业界老问题。香港中文大学、字节跳动Seed和斯坦福大学研究团队提出序贯策略优化框架SeqPO - SiMT,在70亿参数规模实现SOTA,翻译质量媲美Qwen - 2.5 - 7B离线水平。

量子位
开源动态8

集GraphRAG 和 DeepSearch于一体的智能问答系统graph-rag-agent

本项目结合GraphRAG与私域Deep Search,实现可解释、可推理的智能问答系统。亮点有从零复现GraphRAG、创新融合DeepSearch等,具备多模块功能,还有简单演示,地址https://github.com/1517005260/graph-rag-agent/blob/master/readme.md。

GitHubStore