「直接偏好优化」共找到 1584 篇相关文章
GEO最新风向:Google官方GEO分享与Bing站长工具GEO新功能,附白杨SEO看法
本文整理谷歌和必应官方GEO分享。Google的Danny Sullivan谈AI搜索,强调好SEO即好GEO,内容要非同质化;Bing预告站长工具GEO新功能,如优化建议、引用份额指标等。
刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA
AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。
Meshy用户破千万后杀向新战场:ARR年翻14倍,头部厂商集体买单
Meshy是计算机图形学大神胡渊鸣创立的AI 3D公司,其创意工坊打通“AI创意→实体交付”。Meshy生成模型打印适配度高,破圈至多元领域,注册用户破千万,ARR年翻14倍,获多轮融资。
Vidu Q3:「参考生」之王,让视频生成走向工业化量产时代
Vidu Q3 上线「参考生」功能,解决 AI 视频生成结果不可控问题。其画面参考范围扩大,特效、音效提升显著,还优化特定场景,接入企业级能力,让 AI 视频从创意验证走向实际生产。
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
作者分享使用豆包语音通话功能体验,发现它换了新语音模型 Seeduplex。该模型是原生全双工语音大模型,解决半双工问题,在复杂场景表现出色,还介绍其技术逻辑及对行业的影响。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度
深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。
不写、不看、不审查:这家安全公司决定不再让人类碰代码,还把这套模式开源了
2026年2月,安全公司StrongDM公开“软件黑灯工厂”式生产线成果,人类不直接写代码和审查,由Agent自动生成。该模式开源,虽有开发者指出问题,但获学界认可,不过面临成本高的现实问题。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。