「学术视频自动化」共找到 1571 篇相关文章
OpenClaw不会蛋炒饭!Ropedia放出人类经验,机器人「教科书」来了
当LeCun和李飞飞各自拿下10亿美元押注世界模型时,一个更底层的问题浮出水面:谁来为Physical AI提供真正能用的数据?Ropedia给出的答案,不是更多视频,而是一部结构化的、来自真实世界的「经验百科全书」。
Khosla 继 OpenAI 后的最大赌注,General Intuition 凭 38 亿个游戏高光片段做世界模型
今年10月,General Intuition完成1.34亿美元种子轮融资,由Vinod Khosla领投。它从Medal分拆,有38亿游戏短视频片段,可赋予机器“直觉和物理常识”,与LLM互补,商业化将从游戏拓展到物理世界。
离谱:打造超10亿美元的独角兽,从真人假扮成AI开始
2017年两位创业者多次失败后,决定做自动记录会议笔记的AI助手,却无AI技术,便真人假扮。这种模式竟让他们赚到钱后开启自动化。如今Fireflies.ai估值超10亿美元,但早期做法引隐私等争议。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
Suno V5让整个B站开始文艺复兴了。
文章指出B站鬼畜区曾没落,如今因Suno V5迎来文艺复兴。爆款AI音乐鬼畜频出,如漫游会议室的作品。介绍了用Suno V5创作歌曲及视频的方法,还强调鬼畜精神回归,小破站分享快乐的意义未变。
Andrej Karpathy 开炮:智能体都在装样子,强化学习很糟糕,AGI 十年也出不来
本周五,Andrej Karpathy 长达两小时多的采访视频引发关注。他直言行业步子迈得太大,嘲讽 AI 现状夸大、脱离实际。他认为智能体成熟需十年,强化学习糟糕,还探讨了 AGI、人类学习、教育未来等多方面问题。
清华大学x生数科技:从波形到隐空间,AudioLBM引领音频超分新范式
音频超分辨率是提升音频体验的关键技术,但高频细节损失是挑战。OpenAI的Sora 2树立高保真音频生成标杆,现有学术模型有局限。清华与生数科技团队发表两项成果,AudioLBM展现通用高分辨率音频生成潜力。
国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型
中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。
字节Seed开源长线记忆多模态Agent,像人一样能听会看
字节Seed发布全新多模态智能体框架M3 - Agent,能听会看、有长期记忆且免费开源。团队还开发新长视频问答基准M3 - Bench并开源。实验显示,M3 - Agent在多基准测试中显著优于基线模型。
宇树新机器狗太猛了!1米高石阶轻松爬,越野快到出残影,网友:这不是AI生成的???
宇树新机器狗Unitree A2星际猎影实力惊人,全视频无加速展示跑酷、爬山等技能。它有超广角激光雷达3D感知系统,能自主避障,还很轻、强、快,承载能力佳,官方未公布售价和上市日期。