视觉原语」共找到 871 篇相关文章

新闻资讯8

AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开

500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还历法转换表三大难题,展现惊人能力。

新智元
开源动态8

DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!

DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。

开源星探
新闻资讯7

ChatGPT新功能,又干掉一批创业项目

ChatGPT推出新功能分支对话,点击按钮就能在对话基础上岔话题。此前不少创业公司主打此功能,如T3.chat。该功能已上线,对团队协作有用,网友提改进建议。此外,“项目”功能也免费开放,不同用户文件上传限制不同。

量子位
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
开源动态8

刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座

Dexmal力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其预训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。

新智元
新闻资讯7

卡帕西点赞特斯拉餐厅,马斯克:兄弟,你再回来吧

特斯拉餐厅太火,特斯拉AI大神Karpathy点赞,马斯克邀其回归。餐厅有机器人员工、超级充电站,组合引关注。不过营业首日擎天柱出事故,且目前擎天柱发展混乱,马斯克却计划让它2026年当送餐员。

量子位
开源动态8

最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26

多模态大言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。

新智元
产品应用8

DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了

DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。

AIGC开放社区
产品应用7

我雇了个AI,替我读微信列表里“吃灰”的公众号文章

文章评测了AI工具鲸,它像国产版NotebookLM和AI版今日头条,能处理文本、整合资讯。它可订阅多渠道账号,有订阅、频道等实用功能,网页端解析长文出色,但处理图文有问题,其团队背景强大。

量子位
开源动态8

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到模型0.1%,多方面表现获改善。

机器之心