「思维锚点」共找到 1055 篇相关文章
刚刚,AI大牛刘威视频创业公司Video Rebirth,完成5000万美元融资
AI视频初创公司Video Rebirth完成5000万美元融资,由刘威博士创立,致力于打造“视频原生的世界模型”。融资用于视频模型迭代等,解决行业痛点,其核心创新机制让模型表现突出。
无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」
清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。
Agent 一年半开发复盘:大家对 Agent 的理解有错位,有效的「认知流程」很关键
本文是作者对一年半AI开发过程的复盘,指出大家对Agent理解有错位,强调有效「认知流程」的关键作用。通过高考、学霸成长等例子阐述Agent核心,对比Chatbot与Agent,还从理论视角解释其有效性,最后点明开发者角色转变及面临的挑战与前沿探索方向。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。
中国AI高速路,华为给出开源开放方案
上周华为全联接大会展示系列创新。超节点架构带动的开源开放意义深远,开放硬件、开源软件和灵衢组件。华为发布系列超节点新品,实现全场景覆盖,同时全面开放开源,推动产业协同与生态繁荣。
通用Agent是伪命题?昆仑万维方汉现场拆解:垂直推理才是胜负手|新智元十年峰会
在新智元十周年峰会上,昆仑万维董事长方汉分享公司转型故事与多模态AGI见解。他认为通用Agent非万能,垂类推理数据是关键,还提出AI商业落地逻辑,展示多款产品成果。
如何让AI“看懂”网页?拆解 Browser-Use 的三大核心技术模块
传统Browser - Use难应对界面变化,大模型驱动下正迈向智能化。文章拆解其三大核心技术模块,介绍历史发展、核心功能,分析源码各模块,指出创新点与不足,还提及业界更好解决方案。
笑死,人形机器人运动会全是鬼畜名场面!这锅粥大家来趁乱喝了吧
首届人形机器人运动会在国家速滑馆举行,现场状况频出,如机器人撞人逃逸、摔倒、抢球混战等。比赛项目多样,包括足球、拳击等。解说重点是AI知识,比赛规则也为机器人量身定制。
AI 当导演编剧和剪辑?FilMaster打开自动化电影创作新纪元
当前多数AI电影生成系统难达‘专业级’,香港大学推出FilMaster系统。它融合摄影语言与后期制作流程,分两阶段创作电影,能生成高质量作品,但高级后期制作技术未纳入。
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。