4D生成」共找到 3728 篇相关文章

开源动态7

智谱新模型也用DeepSeek的MLA,苹果M5就能跑

智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。

量子位
推荐文章7

AI 已能写 80% 代码,但 Agent 也有致命短板!OpenAI Codex 技术总监:问错了,比不会写更麻烦

OpenAI Codex 技术负责人 Michael Bolin 在访谈中回顾职业轨迹,分享从工程师到工具创造者的成长经历。他认为 AI 编程时代 80%-90% 代码可由模型生成,但关键部分需人类把控,提出正确问题能力更重要,编程智能体执行将更多迁移到云端。

InfoQ
产品应用8

0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App

腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。

量子位
开源动态7

非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存

谷歌提出的Transformer架构基本垄断大模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。

机器之心
开源动态7

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。

MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。

数字生命卡兹克
算法论文8

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。

量子位
产品应用7

前百川联创下场、字节腾讯入局,到底谁在看好 AI 播客?

近期前百川智能联创焦可的‘来福’、前妙鸭相机产品负责人张月光的 ChatPods 等 AI 播客产品上线。‘来福’播客全由 AI 生成,国内多款同类产品也相继登场。虽产品效果能达及格线,但在多数播客场景难替代现有内容。

Founder Park
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
开源动态7

香港科技大学、Manycor开源空间大模型,超3000颗星

香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。

AIGC开放社区
8

老罗数字人爆火背后,百度做对了什么?

6月15日,罗永浩数字人在百度电商直播超6小时,吸引超1300万人次观看,带货破5500万元。它动作、语调等生动,能与弹幕互动。百度基于文心4.5T,从形、音、神让数字人“神形音容”一致,还实现行业首次多数字人同场及头部主播数字人整场带货。

特工宇宙