视觉逻辑排版」共找到 1045 篇相关文章

算法论文8

AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?

北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。

机器之心
产品应用8

真情实感体验了阿里「千问APP」后,为什么说它是「中国的ChatGPT」?

近日阿里推出面向全球的千问APP。从产品定位、模型能力、效果来看,它接近ChatGPT,是“中国的ChatGPT”。它打通Qwen模型和应用,界面极简,功能多,体验佳,有望让大家重新认识阿里大模型应用。

机器之心
算法论文8

空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer

香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。

机器之心
新闻资讯7

00后MIT华人女生辍学创业,已融1.5个亿

00后华人女生Jessica Wu从MIT辍学,创立Sola Solutions,定位RPA界Copilot,获2100万美元融资。公司用LLM和计算机视觉构建自动化流程,已应用多行业,收入增长快。

量子位
算法论文8

具身智能体主动迎战对抗攻击,清华团队提出主动防御框架

面对对抗攻击,现有防御方法多为‘被动防守’,遇上未知或自适应攻击时效果衰减。清华朱军团队在TPMAI 2025中提出主动防御框架REIN-EAD,通过与环境交互实现‘感知—决策—行动’一体化,实验效果佳。

量子位
开源动态7

5000 star,Harness门槛被OpenHarness打穿了

分享开源Python实现版本OpenHarness,它易上手,能助研究者和开发者理解生产级AI Agent原理、构建专用智能体。介绍其核心功能、架构及核心循环逻辑,还给出了Github链接。

PaperAgent
新闻资讯7

“干了20年,没见过这阵仗”:一句话说明存储行情有多火

当前存储行情火爆成‘超级风暴’,产业链各方看法不一。AI算力驱动需求,致产能被挤占,行业从‘周期性短缺’到‘结构性缺货’,市场规则改变,上下游悲喜不同,终端厂商也面临诸多挑战。

芯师爷
开源动态7

被DeepSeek带火的OCR,最新8个开源模型盘点~

DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。

PaperAgent
新闻资讯8

刚刚,OpenAI Sora 2重磅登场!首个APP上线,或将成为AI时代新TikTok

凌晨1点,OpenAI推出Sora 2,AI视频迎来「GPT - 3.5时刻」。它物理智能提升、实现音画同步,人物一致性等刷新SOTA。Sora App上线或重塑短视频交互与社区互动,还在安全治理上布下多层防线。

新智元
产品应用8

AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击

Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。

AI工程化