「异构对比微调」共找到 785 篇相关文章
InfiniteTalk:音频驱动的从口型到全身动作同步方法
近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。
谷歌版小钢炮开源!0.27B大模型,4个注意力头,专为终端而生
谷歌开源Gemma 3 270M,几分钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。
重磅!Meta开源通用神经输入系统!人人可用的非侵入式手环登场
Meta开源通用神经输入系统,用基于手腕的输入技术结合上下文感知AI带来新交互体验。关键技术EMG可读取大脑电信号,将其转成数字命令,系统表现优秀,为“隐形”人机交互奠基。
揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~
LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持多格式输出。在多行业有应用,性能提升显著,与同类项目相比优势明显。
建模世界偏好:偏好建模中的Scaling Laws
研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。
狂揽22.6k星!这个开源工具让你一键调用100+大模型,开发效率直接起飞!
LiteLLM是BerriAI团队开发的开源工具,通过标准化OpenAI格式API接口,能无缝调用100+主流大语言模型。有核心功能亮点,适用于多场景,还给出上手步骤,并与同类项目对比。
2026 Data+AI 中场纪实:企业决策者,敢把真实业务交给 Agent 吗?| 直播预告
Snowflake携手InfoQ发起直播,探讨企业将真实业务交予Agent的问题。贾天下将分享相关内容,其博客展示有本体团队可实现的能力,还通过生物医学基准测试比较不同方案,为构建企业级AI智能体提供参考。
信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26
联邦学习中兼顾模型性能、数据隐私和通信开销是挑战,尤其在模型异构场景。信通院和清华联合团队提出FedRE框架,能适配异构与同构场景,保证性能同时保护隐私、降低开销。
时隔9个月Meta全新模型Muse Spark发布:闭源,原生多模态,一发布就落后?
时隔9个月,Meta推出Muse家族首款大模型Muse Spark,原生多模态推理,但能力表现一般,编程领域落后于opus 4.6和GPT 5.4等。它有沉思模式,致力于成个人超级智能,技术亮点多,性能高效。
震惊!13万Star的GitHub仓库泄露了30+款AI工具的核心机密
system-prompts-and-models-of-ai-tools项目是AI界“维基解密”,收录30+款AI工具核心系统提示词。从多维度解密,有完整提示词、跨工具对比等。适用于多种从业者,还给出使用方法。