「悟能平台」共找到 5998 篇相关文章
超20万个高质量Skills!浙大等联合推出SkillNet,告别孤立Skill实现自进化
浙江大学联合多家机构推出开源基础设施SkillNet,拥有超20万个高质量Skills。它能让AI智能体告别失忆式工作,将互联网资源和人类经验转化为可执行Skills,构建Skills网络,经严苛评测,在真实场景验证了强大实战能力。
爆火全网FLUX.2重磅上线,开源版Nano Banana来了!
Black Forest Labs的开源视觉模型FLUX.2上新,是专为现实创意工作流程打造的生产力工具。与前代相比,实现从「会画」到「懂你要画什么」跃升,还能在多方面保持一致性,各变体有不同定位与场景。
OpenAI突然发布Sora 2:好一个“AI版抖音”!
OpenAI重磅上新,带来依托Sora 2的“AI版抖音”——Sora iOS APP。Sora 2是音视频同步生成模型,更遵循物理定律、可控性强,还能注入现实元素。实测效果佳但画质低,Pro版可改善,后续还会发布API。
阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%
阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。
再见Bug!谷歌超级编码智能体Jules上线,免费使用直连GitHub
谷歌推出编程智能体Jules,进入全球测试阶段,有Google账户的开发者可免费试用每日5次。它基于Gemini 2.5 Pro模型,能写代码、修Bug等,还可连GitHub简化流程,预计今年晚些时候推更多功能和企业版。
谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角
电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。
字节推出X-Streamer,实时口型同步与长程记忆数字人框架
字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。
骨灰级克隆网站设计的开源项目
现在克隆网站设计常停留在截图和吸色,难以完全还原。designlang 项目用无头浏览器打开 URL,从实时 DOM 读取设计系统,输出多个文件,还能做到布局模式等其他提取器做不到的事。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
蛰伏三年,前大疆员工做了款消费级纺织机,拿下红杉、顺为、米哈游等数亿融资|产品观察
浪爪智能创始人胡文鑫出身大厂,却投身家用纺织机赛道。公司已获数亿融资,2024 年推出自动簇绒枪,还打磨消费级纺织 Station 平台,即将发布新品并搭建社区。团队解决诸多技术难题,满足不同用户需求。