「层级视觉识别」共找到 915 篇相关文章
干掉 .md?兜里 Token 不够,没法和 Karpathy 共情
近日,围绕‘Markdown 是否已过时’讨论升温。Theo Browne 视频阐述‘HTML 优于 Markdown’五大理由并分享实操技巧,虽指出 HTML 有费 Token、版本控制差问题,但仍倾向用 HTML,不过也有开发者质疑。
穿越100年前打造的AI,不知道二战和互联网,却从几个例子学会了Python
前OpenAI研究成员等打造出130亿参数的时代语言模型talkie,只用1930年前英文词元训练。它不知二战等现代信息,能从例子学Python,风格似20世纪绅士,研究团队将扩大其规模。
Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了
Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,人类干预减少。该版本能力大幅增强,还引入护栏机制保障安全,推出新运算级别和任务预算功能。
剪辑 Agent 字幕升级:99% 正确率的字幕,一条指令直接推进剪映
作者成峰重做剪辑 Agent 字幕功能,结合 capcut - mate 项目,接入语音识别服务等优化流程。字幕准确率最高达 99%,还介绍了 5 步使用方法,解决非技术用户使用门槛问题。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
第二代AI预训练范式:预测下个物理状态
英伟达科学家Jim Fan发布文章《第二代预训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的预测」,在物理世界应用中「水土不服」,第二代范式应是「预测下一个物理状态」,引发机器学习社区讨论。
AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?
北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。
仅有一位作者的论文,却补上了城市智能的「最后一公里」
郑宇教授用论文提出跨域多模态知识融合框架,在空气质量推断等多场景优势明显,其研究按数据选择等四阶段进行,解决数据难题,推动AI用于城市问题,为跨部门协作提供可能。
「死亡互联网理论」刷屏硅谷!Reddit创始人预警,奥特曼公开发声
近段时间,「死亡互联网理论」刷屏硅谷,Reddit联合创始人称互联网被AI内容淹没,失去了真实的生命力。OpenAI创始人Sam Altman也认同其有一定道理。如今AI浪潮加速了互联网「死亡」,还可能带来模型崩溃。