「视觉神经增强」共找到 1090 篇相关文章
李飞飞最新长文:AI的下一个十年——构建真正具备空间智能的机器
李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》,解读空间智能,阐述构建具备空间智能机器的核心框架,探讨其应用场景,认为这是AI下一个前沿。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
Meta 发布 Docusaurus 3.9,新增 AI 搜索功能
近日 Meta 发布 Docusaurus 3.9,重点更新有现代化运行时环境、增强 AI 搜索能力、提升国际化灵活性。如支持 DocSearch v4 让用户对话查内容,提高 Node.js 最低要求,改进 i18n 配置等。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
比Transformer更强的架构来了?浙大新作Translution,一统卷积和自注意力
随着大模型发展遇瓶颈,浙大等校学者提出神经网络基础操作Translution,实现自注意力与卷积的融合统一,构建更普适神经计算机制。它性能超Self - attention,为新一代神经网络发展开辟新方向。
HAMi 2.7.0 重磅发布 | 异构芯片全面拓展,调度更稳、生态更强
Dynamia密瓜智能宣布发布HAMi 2.7.0版,在硬件生态、调度器、应用层生态等方面有显著进展。硬件上支持昆仑芯、燧原、AWS等芯片;调度器优化了资源计算和可观测性;应用层与vLLM、Xinference等整合。
具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集
近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。
高通祭出全球最快移动SoC!卢伟冰携全球首发小米17Pro现身
2025骁龙峰会·中国会场,高通推出第五代骁龙8至尊版移动平台,采用台积电3nm制程。小米17系列将全球首发,多家厂商也会搭载。该芯片在CPU、GPU、NPU等多维度性能提升,还在影像、音频和通信方面有飞跃。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。