视觉逻辑排版」共找到 1046 篇相关文章

新闻资讯7

具身导航:感知推理是上帝,还是执行控制是命门?| GAIR Live 023期预告

具身导航正从‘几何避障’向‘空间智能’跨越,当前领域经历范式变革。GAIR Live 023期线上圆桌将聚焦其前沿进展与落地问题,邀请两位专家拆解底层逻辑,还给出了核心议题、讨论精华预览及参与方式。

AI科技评论
开源动态7

长视频会议纪要、访谈节目精剪AI神器

WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。

GitHubStore
新闻资讯7

ChatGPT确认卖广告!奥特曼:挣钱嘛不寒碜

2026年1月16日,OpenAI官宣ChatGPT免费版和Go版引入广告。奥特曼称因多数人想用AI又不付费,只能以此盈利。这背后是大模型行业受开源模型冲击,陷入定价困境,开源模型改变了行业预期和估值逻辑

新智元
新闻资讯7

陶哲轩亲自曝光:AI破解数学难题,竟全是「抄」的?

数学大神陶哲轩发现,AI声称破解的Erdos难题,实则是多年前已被人类解决的旧闻。他指出当下AI进化逻辑并非创新,而是利用算力扫描人类文献的‘长尾黑洞’,其核心价值是填补人类知识遗忘漏洞。

新智元
开源动态8

让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen

NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。

AIGC开放社区
开源动态8

罗福莉执掌小米大模型首秀!定调下一代模型,全新MiMo-V2开源还横扫Agent第一梯队

在2025小米人车家全生态合作伙伴大会上,罗福莉首秀解读全新大模型MiMo - V2 - Flash,该模型已开源,采用MoE架构和MTP技术,在多方面表现出色,罗福莉还阐述其设计逻辑与对下一代智能体的看法。

AI前线
算法论文8

上海AI Lab提出CANON:让RLVR自主识别优质推理模式

上海AI Lab与上海交大团队提出创新框架CANON,解决将人类先验知识融入RLVR训练的难题。它通过条件分组与对比机制,自适应放大有益指标变化趋势,在数学和逻辑推理任务上成果卓越,还能提升推理效率。

深度学习自然语言处理
算法论文8

用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架

华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。

量子位
产品应用8

以「场景」定义算力:AI时代,通用算力不只“通用”

当AI狂欢席卷全球,阿里云和AMD通过‘一芯三用’重新定义AI时代算力选型逻辑,从‘参数崇拜’回归‘业务本质’。联合发布三款基于AMD Zen 5架构‘Turin’处理器的全新ECS实例,精准匹配不同业务场景需求。

InfoQ
推荐文章8

在WAIC耳朵听出茧子的「智能体」,是时候系统学一下了

今年世界人工智能大会上,智能体成主角,AI厂商纷纷布局。文章指出人们对AI大模型期望转变,介绍智能体底层逻辑,涵盖工具使用、推理模型、ReAct框架等,还对比先前尝试,探讨智能体能力层次与未来发展。

机器之心