「多token预测」共找到 4904 篇相关文章
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
幻觉的根源找到了:大模型说谎,是为了讨好你
清华大学OpenBMB团队研究发现,大模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在预训练阶段形成,为构建可靠模型提供新视角。
GPT-5-Thinking新训练方法公开:让AI学会忏悔
OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。
大小模型协同架构在金融智能投顾中的应用与挑战
本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
这家 AI Lab 宣布所有模型无限期免费后,我顺手做了个图片版番茄钟
全球排名前十的 AI Lab,Agnes 宣布旗下核心全模态模型 API 无限期免费开放,包括文本、图片、视频。还新增百万 Token 上下文和 4K 图片生成功能。作者用其做了图片版番茄钟,官方也公开开发进度。
Agentic AI 时代,软件工程如何被重塑|QCon北京2026即将开幕
QCon全球软件开发大会·2026北京站4月举办,以“Agentic AI时代的软件工程重塑”为主题。大会有主题演讲探讨Agentic AI边界,设多个专题解析工程化核心,还关注AI向物理世界延伸,讲师分享一线实践经验。
谷歌Agent正在憋大招:AI科学家内测,锦标赛制“炼”想法,一次跑40分钟
谷歌正为Gemini Enterprise开发多智能体系统,能扮演联席科学家提炼想法,实现研究自动化。工作时以锦标赛形式评估想法,一次运行约40分钟,还准备了“想法生成”“联席科学家”等智能体。此外还有“与文档对话”功能。
终于等到你!阿里上线全新免费AI IDE工具——通义灵码
今年AI行业卷AI Agent和AI Coding领域,都在推自家IDE。阿里有Qwen3加持,现发布全新免费AI IDE工具通义灵码。该工具具备内置Qwen3、MCP支持等特点,还有NES智能修改预测等功能。