「开源精神」共找到 2989 篇相关文章
10K Star!这个 AGENTS.md 开源项目太赞了,AI 编程助手彻底悟了!
AI 在看 README 时理解能力差,被戏称“智商只有三岁”。AGENTS.md 是专门写给 AI 编程智能体的文档格式,已获 10K Star,可助其理解项目,还介绍了与 README.md 的区别、使用方法等。
语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!
在大模型浪潮下,语音领域迎来“整合与统一”趋势。阿里蚂蚁团队推出端到端统一语音模型Ming - UniAudio,能在一个框架下完成识别、生成、编辑等任务,语音编辑能力创新,开发者上手简单。
首个代码世界模型引爆AI圈,能让智能体学会「真推理」,Meta开源
Meta重组后的AI部门推出首个代码世界模型CWM,是320亿参数开放权重LLM。它与传统大模型思路不同,能模拟代码执行。CWM在通用编程与数学任务表现不错,Meta还开放相关检查点以支持研究。
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。
“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!
7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。
文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平
澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。
750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集
上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。
DeepSeek R1/V3作者开源轻量级vLLM,1200行代码读懂大模型推理技术!
DeepSeek R1/V3作者俞星凯开源轻量级vLLM——Nano - vLLM。它有快速离线推理、代码可读、含优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B模型的基准测试配置。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。
视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系
香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。