「视频训练」共找到 2994 篇相关文章
刚刚,北大校友Lilian Weng自曝公司首个产品?一篇论文未发,估值却已90亿
OpenAI前安全副总裁Lilian Weng疑似曝光90亿估值新公司Thinking Machines首个产品——手动调参仪表盘,训练中可手动调超参数。OpenAI也有AI硬件野心,设想让ChatGPT成全能硬件助手。
靠「AI婴儿播客」拿到a16z 3200万美元投资,Hedra凭什么?
Hedra是生成式AI创企,凭「AI婴儿播客」获关注,刚完成3200万美元A轮融资。它与主流AI视频平台路线不同,构建全模态基础模型,播客成杀手级应用,研发成本低,踩中赛道转型。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
这个开源项目 OpenStory,把 AI 短剧制作变成了一条可复制的工业流水线!
现在制作完整AI短剧流程繁琐,很多团队是小作坊式生产,效率低且难规模化。OpenStory开源项目站在成熟AI服务肩上,将AI短剧制作工业化,能把剧本变成风格统一的视频作品,解决诸多痛点。
The Batch: 969 | 谷歌的机器人模型有了腿
谷歌发布 Gemini Robotics 2(GR2),能将相机图像和文字指令转为机器人关节控制命令,可同时控制人形机器人腿、躯干、手臂和手部,简化模型训练和设计,不过谷歌未公布其基础模型等信息。
MiniMax 怎么做 Agent:Model-Harness 协同只是第一步,还有 Inference-Harness 协同
本文介绍了 MiniMax 在 Agent 层面的实践。从内部飞书 bot 起步,发展成桌面应用 MiniMax Code,形成训练 - 服务闭环。还阐述 Agent 对模型优化迭代的作用、自研 Agent 优势,指出 AGI 是闭环递归自我改进系统。
Meta 开源 Brain2Qwerty v2:非侵入式脑机接口语句解码准确率达到 61%
Meta 近日开源非侵入式脑机接口系统 Brain2Qwerty v2,能将人脑想法解码为完整语句,平均单词识别准确率达 61%,远超其他非侵入式方案。其采用三阶段深度学习模型,代码和训练数据已公开。
这家 AI Lab 宣布所有模型无限期免费后,我顺手做了个图片版番茄钟
全球排名前十的 AI Lab,Agnes 宣布旗下核心全模态模型 API 无限期免费开放,包括文本、图片、视频。还新增百万 Token 上下文和 4K 图片生成功能。作者用其做了图片版番茄钟,官方也公开开发进度。
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
大基金或将领投DeepSeek?算力拐点将至
5月6日报道国家大基金正洽谈领投DeepSeek首轮融资,估值约450亿美元。大基金此前未公开投资大模型公司,此次若落地是从“半导体硬件”向“AI应用端”延伸。2025年是中国AI芯片出货量关键年份,DeepSeek-V4发布,多家国产芯片品牌完成适配,但国产芯片仍面临性能、软件生态等挑战。