「视觉解释」共找到 785 篇相关文章
刚刚,DeepSeek官宣更新了!突然「变冷」冲爆热搜
DeepSeek官宣网页版、APP更新,支持100k token上下文,但更新后性格变冷淡引争议。官方称是效率优先和边界意识所致。此外,传言V4将发布,编程实力或超Claude、ChatGPT等。
别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程
作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。
Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了
传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
信息熵之后,清华提出状态熵!量化分析「系统智能性」的全新视角
清华大学科研团队从自治系统的演化动力学出发,提出状态熵概念,分析其与系统聚合度关系,为系统智能性度量提供新视角。论文给出状态熵统一定义及演化解析表达式,还在典型系统上分析其演化规律。
Claude Code 史诗级更新!AI 编程进入“反向教学”模式,写到一半会停下考你:这行代码你来写
Claude Code和Claude App推出学习模式,Claude Code支持用`/output-style`定制沟通风格,有Default、Explanatory、Learning三种内置风格,还能自定义,Claude App的Learning风格也全面开放。
AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击
Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。
谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖
Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。
快速理解热门LLM大语言模型
本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍大模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。
世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单
近年来,世界模型成视觉 AI 重要研究方向。兔展智能联合研发的 UniWorld - View 登顶 WorldScore 榜单,完成昇腾算力适配与开源。它聚焦让 AI 理解未拍摄世界,解决了诸多技术难题。