「纯视觉驱动」共找到 1318 篇相关文章
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。
MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV
上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。
万卡时代,企业需要怎样的算力集群?
过去两年,AI算力需求跃升,消耗从训练主导转向推理驱动。企业算力需求有突发性等特点,智算集群是关键方案。InfoQ联合腾讯云发起直播探讨,还介绍了算力供给缺口、集群构建交付、性能优化及演进方向。
MiniMax M2 发布即爆,拿下开源模型第一名
10月27日,MiniMax发布新一代文本大模型M2及由其驱动的MiniMax Agent。M2是专家混合模型,参数达230B但激活仅10B。它在开源模型评测中夺冠,能低成本、高速度支撑工作流,开发者评价高。
谷歌开源的 Gemini CLI 扩展助力开发者构建定制化人工智能工作流
谷歌发布开源的 Gemini CLI 扩展框架,引入‘剧本’概念,可让 AI 与外部工具交互。框架增强了 Gemini CLI 功能,支持多组件。谷歌构建开放生态,还为开发者提供模板和指南,其在 AI 驱动 CLI 领域有独特优势。
将科研脏活累活真·丢给AI!上海AI Lab推出深度科研智能体FlowSearch
上海人工智能实验室推出深度科研智能体FlowSearch,它由动态结构化知识流驱动,有三大核心模块。在多个科研基准上性能领先,能让科研更高效,标志科研智能体迈向新阶段,还为未来系统奠定基础。
用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架
华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。
谷歌靠Nano Banana超越ChatGPT!登顶苹果App Store第一,玩疯了玩疯了
谷歌Gemini凭借Nano Banana超越ChatGPT,在多地苹果App Store登顶。Nano Banana好用且免费,驱动Gemini新增2300万用户,还用于编辑超5亿张图片。文章盘点了Nano Banana多种玩法及提示词,谷歌也借此逆袭。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。
金融智能体落地四阶段,同花顺Agent战略与实践全景
在数字化与 AI 驱动下,金融行业变革正酣。同花顺产品总监路忠文解析 AI Agent 在金融领域实践,结合案例揭示其突破传统业务边界的潜力,探讨落地挑战与趋势,还分享了公司自身 AI 探索历程与实践经验。