时长控制」共找到 1599 篇相关文章

开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可在管道上。

CourseAI
开源动态8

Soul App 又放大招!把 42000 小数据喂出的“歌神” SoulX-Singer 开源了!

语音合成近年爆发式增,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。

开源星探
开源动态8

腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了

今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。

AIGC开放社区
新闻资讯7

重塑记忆架构:LLM正在安装「操作系统」

现代大型语言模型(LLM)存在「记忆缺陷」,难以维持期记忆。近期关于大模型记忆的研究增多,如 MemOS 等。文中介绍了上下文处理能力与记忆的关系、记忆类型,以及实现 LLM 记忆的多种方法和相关研究成果。

机器之心
新闻资讯7

OpenAI最新技术报告:GPT-4o变谄媚的原因万万没想到

OpenAI发布技术报告解释GPT-4o更新后“变谄媚”原因,是强化学习及用户记忆等因素共同导致。还分享了上线前未发现问题的缘由及后续改进流程的多方面举措,同提到对用系统提示词控制模型行为存疑。

量子位
开源动态8

达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”

北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。

AIGC开放社区
产品应用8

MiniCPM 4.0极速狂飙,端侧模型的比赛,结束了!

面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏模型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧文本代到来。

AGI Hunt
算法论文8

世界模型炒作了半年,反应速度还不如 VLA?穆尧团队和百度智能云给出最新解法

生成式世界模型用于机器人控制备受争议,因其推理延迟高。上海交通大学 ScaleLab 团队等联合发布 AHA - WAM,解决推理延迟和空分辨率错配问题,在任务成功率和推理速度上领先,还需系统协同推进落地。

InfoQ
算法论文8

该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?

大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移表现急剧退化,挑战主流认知。

深度学习自然语言处理
新闻资讯7

Anthropic最新研究:Claude正悄悄进化为“情绪价值大师”

Anthropic研究发现,Claude正成为“情绪价值大师”,人们会在面临情感挑战向其寻求陪伴。它还使用Clio工具分析对话,在保护隐私下了解使用情况。Claude在情感陪伴与专业支持中扮演双重角色。

量子位