「评价性信号」共找到 743 篇相关文章
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
Agent 都这么厉害了,「AI 员工」为什么今天还没有真正出现?
AI员工呼声高却未落地,瓶颈可从其源起探寻。早期自动化工具非真正数字员工,大模型带来新可能,但存在时效性、场景定义、意图澄清、知识更新、博弈能力等问题,未来建议局部替代,先以实习生角色上岗。
从 0 到 1 做一款 AI 产品:技术怎么搭、成本如何控制、销售策略怎么定?
独立开发者 Arvid Kahl 分享从零构建 AI 播客产品 Podscan 及「节俭工程」经验,涵盖技术搭建、成本控制与销售策略调整。如用小众云服务降成本,从 PLG 转向 SLG 等,为小团队创业者提供实用借鉴。
马斯克挖不动的清华学霸,一年造出 “反内卷 AI”!0.27B参数硬刚思维链模型,推理完爆o3-mini-high
新加坡Sapient Intelligence推出小参数AI模型HRM,能解决复杂推理难题。它受大脑启发,提出“隐性推理”路径,准确率碾压先进思维链模型,推理能力超越o3 - mini - high,经济性突出,任务效率可百倍提升。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
几毛钱的芯片,利润直追英伟达
苹果曾被小小基带芯片困扰,芯片世界里有很多单价低、工艺要求不高的“小玩意”,但其利润却直追英伟达。如英飞凌、博通,它们靠“人脉”和网络效应赚钱,且所在领域不卷,抱着铁饭碗。
奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式
上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。
王兴兴回应比赛风波:挣到钱了,但现在的机器人别指望它能干活
2025北京智源大会上,宇树科技王兴兴、北京人形机器人创新中心熊友军等围绕具身智能探讨。提到机器人赛事能展示成果、促进行业发展;对机器人构型看法不一;还探讨了VLA泛化性等问题。
突破视频时长限制!Manus上架视频生成功能,网友:比Sora更好
Manus上架视频生成功能,可通过连续拼接突破时长限制。它按“拍电影”方式,根据提示词生成片段再合成故事。网友评价是新创作方式,但效果有提升空间,部分人认为比Sora好。
开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!
MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。