「复杂运动生成」共找到 3042 篇相关文章
万字硬核解读SAM 3:不止分割一切,它开始理解世界了
Meta的SAM 3能理解语义,实现可提示概念分割。它支持开放词汇、全实例分割等,架构有创新,数据引擎高效。评估显示其性能优异,与MLLM结合成SAM 3 Agent后推理分割能力强,但在专业领域和复杂场景有局限。
活久见!连Linux之父等“顽固派”大佬,都在用AI编程了
生成式AI席卷软件行业,曾对AI编程嗤之以鼻的编程界大佬态度转变。如Linux之父Linus、Redis之父antirez开始用AI编程,Java之父James虽质疑但也认可其实用价值。不过,Vibe Coding不适用于Linux内核开发。
即梦图片4.0来了,我整理了10个好用到爆的进阶玩法。
字节即梦图片4.0背后是seedream4.0模型,与NanoBanana性能相当,但支持直出4K图、自由控比例、文生图审美和可控性强,中文字生成领先。文章整理了它在虚拟模特、换装等10个方面的玩法。
DeepSeek有点含蓄了,实测V3.1有进步,编程等个别场景硬刚GPT-5
DeepSeek悄悄更新V3.1,官方仅提及上下文长度拓展至128K。实测其代码能力与前端审美提升,逻辑推理也有进步,在编程等个别场景能硬刚GPT - 5,但处理复杂任务还有距离,更新不大却有进步且降价。
解决扩散模型过拟合的创新框架T-LoRA
预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。
12月首炸!可灵 O1 正式发布,全球首个统一多模态视频大模型,强得可怕!
12月快手旗下可灵发布全球首个统一多模态视频大模型Kling O1,标志AI视频进入“全流程语义控制时代”。它将多种视频创作能力统一,有全能引擎等五大亮点,性能对比优势明显,让AI视频生成更可控。
00后8亿美金「掀桌」!硅谷AI将书写影视新传奇,终结制片旧时代
00后华人女CEO Cecilia Shen带队转型Cybever为全球首家AI原生影视工作室Utopai Studios,首年获1.1亿美元收入。其技术从3D虚拟环境生成发展到完整视频制作,还推出两部大作,或改变影视行业格局。
微软AI CEO:倒计时18个月,AI将接管这些美国白领
微软AI CEO苏莱曼称未来12 - 18个月,诸多白领工作将被AI自动化。微软启动大规模自愿退休买断计划,虽未提AI,但各项动作都指向它。不过,现实中AI对岗位的替代情况复杂,也创造了新岗位。
OpenClaw 最新必装10个Skills实战教程,真正做到养智能"小龙虾"
本文介绍2026年爆火的开源AI智能体OpenClaw,它能通过自然语言指令接管电脑执行复杂工作流。文章整理出10个必装Skills,涵盖实时搜索、网页自动化等场景,还给出安装方法、实战案例及常见问题解答,助用户搭建稳定环境。
56倍加速生成式策略:西交大提出EfficientFlow,迈向高效具身智能
生成式模型在机器人和具身智能领域面临训练依赖大量数据、推理慢的问题。西安交通大学团队提出EfficientFlow,融合等变建模与高效流匹配,提升数据效率,压缩推理迭代步数,在多基准实现SOTA,推理提效显著。