「视频跟练」共找到 1068 篇相关文章
花了几百万办完一场AI大会后,想跟你分享这6个感悟。
作者分享举办AI大会的6个感悟,指出AI强大时线下真实更重要。如AI可消灭信息差但压缩不了体验差,品味是活出来的,线下交流能带来偶然性等,鼓励人们去线下获得真实体验。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
不跟英伟达走老路,这家GPU公司的技术架构藏着哪些关键解?
在国产GPU上市黄金窗口期,天数智芯上市后首场发布会引发广泛讨论。其公布架构路线图,2027年前追赶英伟达,之后转向创新架构设计。还提出回归计算本质、提供高质量算力两条架构判断,并展示边端算力产品及应用。
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣
第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。
跟这个音乐Agent聊会儿,分分钟生成抖音神曲 | 对话音乐创作Agent产品Tunee
量子位智库对话国内首个音乐创作Agent产品Tunee负责人贾朔,探讨了产品适配用户群体、核心交互形式、解决需求模糊性等问题,还提及产品价值、迭代方向及推出智能硬件的原因。
别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师
斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。
刚刚,Top级的视频AI免费了!我反手做了个精致版《牛来》
明星AI实验室Agnes发布的Agnes Video 2.5系列已上线Pavo创作平台。其中,Agnes Video 2.5 Flash免费,适合AI短剧创作者;Agnes Video 2.5每天送积分,适合商业场景。实测显示其效果佳,免费还能大胆试错。
神秘模型排名超 Gemma 4 31B:不跟 Qwen 硬刚,主打“快”和“省 token”
OpenRouter的Elephant模型Trending榜排名超Gemma 4 31B。它是100B参数隐身模型,主打‘智能效率’,在速度、token消耗、指令遵循等方面与其他100B级别模型对比各有优劣,代表极致轻量路线。