原生全模态」共找到 2315 篇相关文章

产品应用8

1700个OpenClaw技巧,我用多邻国的方式学会的!

AI带来学习方式变革,OpenClaw技巧众多难记。智谱清言APP的学习搭子功能,可将GitHub项目生成多邻国式课程,还能处理论文、演讲等素材,通过多种技术实现知识读薄、读活、读透。

量子位
新闻资讯8

对话蚂蚁灵波首席科学家沈宇军:2万小时真机数据,用“慢功夫”做具身智能|甲子光年

蚂蚁灵波首席科学家沈宇军接受专访,称具身智能处于‘GPT - 1时刻’。团队选‘慢’路,积累2万小时真机数据,发布四个具身智能模型并开源。介绍模型架构、优势、问题及未来计划,还谈了开源考量等内容。

甲子光年
新闻资讯7

昔日王者应用商店,将死!OpenClaw或杀死80%手机应用

OpenClaw创始人Peter Steinberger在访谈中称手机里80%的APP已死。OpenClaw能操控设备、完成复杂操作,还让非技术人会编程。不过它有安风险,仍被部分人看好用于企业经营。

新智元
开源动态8

DeepSeek 硬核开源 DeepSeek-OCR-2!弃用 CLIP 改用 Qwen,创新视觉因果流!

昨天开源社区热闹非凡,Kimi 发布 K2.5,DeepSeek 则推出 DeepSeek - OCR - 2,用 LLM 架构替换传统 CLIP 视觉编码器。它核心创新是视觉因果流,能智能规划阅读路径,性能高效且量开源。

开源星探
算法论文8

GAG:超越RAG,无需检索的私有知识注入新范式

在高价值私有场景,主流大模型注入知识的路线各有硬伤。中科院和360AI联合团队提出GAG方案,无需检索、固定底座、单Token、即插即用,实验显示效果佳,也指出跨域组合等局限。

PaperAgent
产品应用8

谷歌Veo 3.1更新:更一致性、更具创造力和控制力

谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。

AIGC开放社区
产品应用8

不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

文章指出企业训练多模态助手,30B 参数的开源多模态模型如 Qwen-VL-30B 是不错选择,但多模态场景下显存需求大。联想 ThinkStation PGX 解决了显存难题,还介绍其性能、优势、适用场景及服务等。

机器之心
算法论文8

DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透

DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。

量子位
新闻资讯8

明年让AI可靠地抢走你的活儿?Anthropic 首席产品官曝新年目标:大模型不拼 “更聪明”,终结“公司上AI,员工更累”尴尬

2025 年智能主体面爆发,编码领域智能体成突破点,Anthropic 的 Claude Code 表现突出,份额超 OpenAI。其首席产品官 Mike Krieger 梳理发展方向,指出明年重点解决企业部署 AI 但员工未变高效问题。

InfoQ
算法论文8

AAAI 2026|视频大语言模型到底可不可信?23款主流模型面测评来了

合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。

机器之心