语音时长控制」共找到 1318 篇相关文章

算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化
算法论文7

剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了

剑桥大学等机构研究指出,大模型执行长任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。

新智元
算法论文8

AI里最大的Bug,却也是人类文明最伟大的起点。

OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。

数字生命卡兹克
算法论文8

破解遥感目标的形状与尺度难题,PKINet二代推理提速近4倍!

PKINet - v2是改进的遥感目标检测模型,能处理复杂形状和尺度变化问题。它在PKINet基础上升级,统一条带与方形卷积,部署折叠为单大核。在多数据集上精度和速度提升,可服务多领域,但对特殊目标仍有检测问题。

新智元
产品应用8

昨天夸国产大模型争气,今天Vidu Q3就霸榜了

国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。

MacTalk
新闻资讯8

Clawdbot爆火背后的9个真相:创始人首次公开访谈全揭秘

Clawdbot(现名Moltbot)爆火,GitHub星数激增。其创始人Peter Steinberger首次公开访谈揭秘9个真相,包括项目原型1小完成、被AI语音回复震惊、被强制改名等,还分享对融资、安全及行业趋势的看法。

花叔
开源动态7

从文本到3D动画:AnimaX重新定义3D动作合成方式

北航与清华推出3D动画框架AnimaX,结合视频扩散模型运动先验与骨骼动画可控性,让任意骨架3D角色自然动起来。其核心方法灵活控制动作,虽有局限,但为3D动画创作打开新局面。

带你学AI
产品应用7

陪5岁小朋友玩到黔驴技穷,我用一张照片给他做了个汪汪队手办。

作者陪5岁小朋友玩,用一张照片结合Hi3D网页和3D打印技术做汪汪队手办。介绍了3D建模、格式选择、代加工等全流程,还分享了成本控制和上色等经验。

探索AGI
新闻资讯7

小扎AI眼镜当场死机,CTO自曝灾难级演示内幕:一个指令干趴自家服务器

小扎演示Meta智能眼镜Ray - Ban Display翻车,AI助手回应异常、视频通话失败。CTO复盘,一是指令致多眼镜激活干趴服务器,二是机糟的Bug。虽演示失败,但Meta仍豪掷千亿布局AI。

新智元
新闻资讯8

Google重磅上线通用世界模型Genie 3 - 此即未来。

Google发布世界模型Genie 3,它与Sora等AI视频产品本质不同,像可实演算的模拟器。Genie 3解决了前辈无法调和的矛盾,在交互、长、控制等方面有突破,虽有局限,但打开新世界大门。

数字生命卡兹克