「可控视觉生成模型」共找到 2795 篇相关文章
字节做了个 AI 手机,钉钉做了台 AI 主机
2025 年末 AI 硬件圈热闹非凡,月初豆包 AI 手机上线刷屏,后因平台风控引发讨论。近日,钉钉发布 AI 主机 DingTalk Real,定位 AI Agent 执行载体,还推出 AgentOS 统一调度,已跑通多企业场景。
ChatGPT也上线了个人年度报告!
OpenAI 让 ChatGPT 上线「Your Year with ChatGPT」功能,根据用户过去一年对话生成专属年度回顾。报告有数据统计、聊天风格分析、年度奖项等,还能预测 2026 年,虽简洁但数据更私密真实。
AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?
北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。
真情实感体验了阿里「千问APP」后,为什么说它是「中国的ChatGPT」?
近日阿里推出面向全球的千问APP。从产品定位、模型能力、效果来看,它接近ChatGPT,是“中国的ChatGPT”。它打通Qwen模型和应用,界面极简,功能多,体验佳,有望让大家重新认识阿里大模型应用。
近500页史上最全扩散模型修炼宝典,宋飏等人一书覆盖三大主流视角
宋飏等人所著《The Principles of Diffusion Models》共460多页,系统梳理扩散模型发展脉络与核心思想,以统一数学框架串联多种视角,是研究者参考资料与初学者入门读物。
空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer
香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
00后MIT华人女生辍学创业,已融1.5个亿
00后华人女生Jessica Wu从MIT辍学,创立Sola Solutions,定位RPA界Copilot,获2100万美元融资。公司用LLM和计算机视觉构建自动化流程,已应用多行业,收入增长快。
具身智能体主动迎战对抗攻击,清华团队提出主动防御框架
面对对抗攻击,现有防御方法多为‘被动防守’,遇上未知或自适应攻击时效果衰减。清华朱军团队在TPMAI 2025中提出主动防御框架REIN-EAD,通过与环境交互实现‘感知—决策—行动’一体化,实验效果佳。
全球最强开源「定理证明器」出世!十位华人核心,8B暴击671B DeepSeek
八大顶尖机构推出开源定理证明器Goedel - Prover - V2,有32B和8B两版本。它在多个基准测试击败671B的DeepSeek - Prover,采用创新技术,以少算力刷爆SOTA,十位华人是核心贡献者。