多码本视觉表示」共找到 934 篇相关文章

8

对话百度文库:不做大模型能直接做的事,能力积累换来竞争壁垒|AI产品Time

百度文库从文档检索平台转型为一站式AI内容获取和创作平台,付费用户超4000万,AI MAU近亿,智能PPT访问量全球第一。访谈中,负责人分享产品理念、优势及运营经验,如不走大模型能直接做的事,从用户需求出发开发功能等。

量子位
开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。

开源星探
产品应用7

只提升2个点?我实测Claude 4.1后,发现官方在骗人

官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。

AI产品黄叔
开源动态8

仅需0.7秒单图像实时3D重建,开源扩散模型

单图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。

AIGC开放社区
新闻资讯7

甲骨文副总裁吴承杨:AI 放大了数据优势,数据融合至关重要

甲骨文公司副总裁吴承杨称AI放大其数据优势,多模融合数据库至关重要。中国区技术咨询部高级总监嵇小峰表示企业构建Agent AI要关注数据访问需求和安全。Oracle用一体化架构解决融合问题,还介绍了相关技术及应用。

AI前线
算法论文8

解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换

视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。

机器之心
新闻资讯7

菲尔兹奖得主预警:AI可能杀死数学!

今年菲尔兹奖得主多伦多大学教授Jacob Tsimerman宣布加入OpenAI从事AI安全研究,因其认为2年内AI将在数学证明领域超越人类。陶哲轩、Timothy Gowers等也对此表示担忧。《莱顿宣言》发布,众多数学家签名抵制AI对数学的冲击。

新智元
新闻资讯7

取消AI考核、零裁员!股价暴跌82%后,多邻国走出了一条反硅谷之路

多邻国曾是 AI 转型标杆,股价一度暴涨,但近一年暴跌 80%。创始人 Luis von Ahn 表示不裁员,曾将 AI 应用纳入考核又取消,分享员工用 AI 开发课程案例,还谈了 AI 局限、对行业影响及公司应对策略。

AI前线
新闻资讯8

“代码 + 编译器”要消失了?马斯克在 xAI 全员会上放话:到今年年底,AI 或将直接生成二进制

xAI 近期出现离职潮,马斯克公开 45 分钟全员大会视频回应。他表示离职是阶段适配问题,强调速度是当前唯一优先级。还公布新架构,涉及 Grok、编程、图像视频、MacroHard 四条线,并预测 AI 未来发展,如年底或直接生成二进制。

InfoQ
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心