「实验研究」共找到 2885 篇相关文章
AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华
随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。
走一步看一步、两三个月就迷茫一次:字节扣子的两年「创业」
字节的扣子刚完成大版本更新,定位“职场AI,就用扣子”。它过去两年像早期创业团队“野生”生长,从Bot Studio到工作流平台,再到扣子空间,如今迈向Vibe Coding,强化“伙伴”定位,值得产品创新者研究。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了
十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模型问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模型性能、效率表现优,并发现 U 型扩展规律。
Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU
对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。
从「会表演」到「更会演」:KlingAvatar2.0让数字人拥有生动灵魂
近日快手可灵团队发布 KlingAvatar2.0 技术报告,数字人能‘生动表达’。它有三大创新技术,如时空级联框架等。实验显示其生动性大幅提升,性能超竞品,推动数字人在多领域规模化应用。
智能流体力学青年学者论坛第28讲:伦敦城市大学Manolis Gavaises教授
智能流体力学青年学者论坛第28讲于2025年12月4日9点至12点在航空楼A110举办。多位学者分享成果,如Manolis Gavaises用机器学习建模多相流;方波李研究超临界流体湍流;陈杰石提出大涡模拟子网格模型等。
兵临OpenAI!谷歌集结2500人「复仇」,Gemini 3夺回AI王座
谷歌发布Gemini 3欲夺回AI主导权。谷歌DeepMind的CTO与AI Studio产品负责人剖析其发布盛况等,称这是与全球用户共建AGI的实验,还谈到模型发展、应用及多模态等问题,也承认仍有提升空间。
句子级溯源+生成式归因,C²-Cite重塑大模型可信度
在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。