「V3.1模型」共找到 9089 篇相关文章
视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理
快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。
AI生图迎来大升级:图像编辑达到像素级!背后团队大多来自Stable Diffusion模型基础技术发明团队
Stable Diffusion缔造者团队创立的 BFL 发布全新图像生成模型 FLUX.1 Kontext,可实现像素级图像编辑。它能以文本和图像为输入,有 Pro、Max、Dev 三版本,已在多平台上线,获用户好评,但也面临竞争。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?
随着大模型能力突破,Agent 从概念走向应用。清华系 Agent 框架 Cooragent 开源获 1.9k stars。其创始人王政认为 Agent 框架要适应多样需求,解决泛化与精确性平衡等痛点,还分享了对 MCP、框架融合等看法。
那个最可能带领人类达成AGI的男人,更新了终极路线图:世界模型+人形机器人,再造下一个AlphaFold
Google DeepMind的Demis Hassabis在All - In Summit访谈分享观点,认为世界模型Genie 3是AGI必经之路,由其引导的人形机器人是关键形态。他还谈及Google DeepMind战略定位、AI在多领域应用及迈向AGI挑战等。
第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型
2026年具身智能行业火热,但技术路线不明。深度机智创始人陈凯在中关村论坛发布具身智能基座模型PhysBrain 1.0,用千余小时人类第一视角数据超越真机数万小时数据成果,开启具身领域‘物理常识’革命。
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。
童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了
Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。
Meta被控盗用成人影片训练AI,遭索赔3.6亿美金,成人影片居然是训练AI的最佳素材?
美国成人影片制作公司Strike 3 Holdings指控Meta自2018年起下载并分享2396部成人影片,约81.7TB,用于训练AI模型,涉嫌严重侵权。Meta未回应,文章还分析了用成人影片训练AI的可能原因。
Soul APP 开源首个 14B 实时数字人!0.87秒延迟+32fps,冲进 I2V 趋势榜 TOP5!
AI圈对数字人爱恨交加,因其存在太假、太慢、太僵硬等问题。Soul App旗下AI团队开源实时数字人生成模型SoulX - FlashTalk,参数量14B,有亚秒级延迟、高帧率等亮点,冲进HuggingFace I2V趋势榜TOP5。