「图像计算」共找到 1111 篇相关文章
高考数学全卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二
因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态大模型。
登顶Hugging Face GAIA全球榜首!中兴超级智能体终结「AI黑盒」时代
中兴通讯研发的超级智能体Co - Sight 2.0登顶Hugging Face GAIA全球权威榜单。它解决传统智能体痛点,有全链路可信计算框架等创新架构,其智能体工厂和开放标准助力构建生态,展现了智能体产业落地潜力。
重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个
DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理多类图像与近100种语言。
完成20亿的融资,这家AI芯片公司也要冲击IPO
近日,AI芯片企业清微智能完成超20亿人民币C轮融资,已启动上市筹备。该公司是可重构计算领导企业,量产多款芯片,与智源研究院合作打造国产AI芯片软件生态,市场表现佳。
马斯克终于成『AI No.1』,6大案例看实力与水分
马斯克发布Grok 4,宣称其超越OpenAI等LLM。它屠了各种榜单,但Grok系列口碑欠佳。文中通过多案例测试,展现其在各方面的表现,如编码、数学、图像等,还提到了API速度和价格。
AI 领域新动向!持续思考模型CTM横空出世:AI 向生物智能迈出重要一步
Sakana AI 推出新型 AI 模型 CTM,重新引入「时间」和「神经元动态」到 AI 计算核心。它有诸多创新,在迷宫探索、图像识别等任务表现出色,虽有训练慢等不足,但为 AI 向生物智能迈进提供新思路。
实测 Seed 2.1:豆包基模超进化,国产模型能力跨过质变点
作者在做面向 Agent 项目时,因 Claude Code 内存开销大,需更轻方案。火山引擎 Force 大会发布 Seed - 2.1,作者实测其在办公、编程、图像理解等方面表现出色,认为它跨越质变点,将赋能国内 AI 生态圈。
微信、清华连续自回归模型CALM,新范式实现从「离散词元」到「连续向量」转变
腾讯微信 AI 联合清华提出连续自回归语言模型 CALM,它将语言建模为连续向量而非离散词元,显著改善性能与计算成本权衡,解决了 LLM 效率瓶颈,虽面临技术挑战但实验效果佳,还指明未来研究方向。
NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源
TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对长视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。
新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘
谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。