K2.5模型」共找到 9202 篇相关文章

开源动态8

登上 GitHub 日榜 TOP5,收获 1.2 万标星的自动剪辑视频开源工具。

video-use是browser-use团队开源的自动剪视频项目,登上GitHub日榜TOP5、获1.2万标星。它改变剪辑交互方式,让用户描述意图,有智能剪辑、调色等功能。技术亮点是双层读取系统,成本和效率更优。

开源星探
产品应用8

苹果M5「夜袭」高通英特尔!AI算力狂飙400%,Pro三剑客火速上新

苹果悄无声息更新官网,三款核心产品14寸MacBook Pro、iPad Pro以及Vision Pro换上全新M5芯片。M5芯片性能提升显著,AI能力连翻数倍,加量不加价,在AI、图形处理等多方面有重大升级。

新智元
算法论文8

普林斯顿大学等Nature揭秘:人类大脑与大语言模型共享同一套语言处理时钟

普林斯顿大学等机构研究发现,大语言模型层级计算序列精确映射人类大脑处理语言的毫秒级时间动态,其与人类大脑理解语言的先后顺序高度一致,为理解大脑和开发神经网络架构开辟途径。

AIGC开放社区
开源动态8

1.2K Star!终于有工具开始认真解决 AI Agent 安全问题了!

作者深度使用AI Agent时担忧其安全性,GitHub上斗象科技开源的ClawVault项目,上线不久获1.2K Star。它为AI Agent提供多场景安全隔离方案,有分格管理、可视化监控等实用设计,适配Python3.10+环境,安装方便。

开源星探
新闻资讯7

GPT Image 2研究科学家陈博远:我在OpenAI修中文

GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。

量子位
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
开源动态8

5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!

今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。

开源星探
开源动态8

刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」

年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。

PaperAgent
算法论文8

视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%

加州大学伯克利分校等团队提出视觉思维链(CoVT)架构,让视觉语言模型推理时生成连续视觉信号。它内化轻量级专家能力,采用对齐策略和四阶段训练,实验显示性能提升,还具可解释性。

AIGC开放社区
开源动态8

谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型

本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升。

机器之心