赋能增值」共找到 5082 篇相关文章

开源动态8

搅局者来了!智谱重磅开源AutoGLM,让“豆包手机”人人可造!官方:AI手机不该掌握在少数厂商手中

智谱团队将核心AI Agent模型AutoGLM完整开源,它有手机操作力,支持上百主流APP。智谱认为AI手机是趋势,不应被少数厂商垄断,开源还解决隐私问题,复用技术经验。

AI前线
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型力。

机器之心
算法论文8

首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」

UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。

机器之心
算法论文8

碾压π0.5,复旦团队首创「世界模型+具身训练+强化学习」闭环框架

复旦团队针对当前 VLA 策略依赖模仿学习、真实机器人在线 RL 成本高、传统物理仿真器有局限等问题,提出 ProphRL 框架。该框架以世界模型 Prophet 为核心,结合 RL 算法,为具身智落地提供更可行路径,实验效果显著。

机器之心
开源动态8

太简单啦,Call Center AI开源代码=AI语音客服,论文Demo一步到位,毕业设计神器!

Call Center AI是微软开源的AI呼叫中心解决方案,基于Azure相关服务和Azure OpenAI GPT,支持自动拨接电话等功解决坐席不足等痛点,有一键API等亮点,适用于保险、IT支持等场景。

小华同学ai
产品应用7

视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1

可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时长和风格转换等。

歸藏的AI工具箱
开源动态7

Crossplane 从 CNCF 毕业,实现了生产环境成熟

云原生计算基金会(CNCF)毕业了 Crossplane 项目,标志其达到重要里程碑。它将 Kubernetes 转成云基础设施通用控制平面,已通过多阶段,有众多贡献者与企业用户,虽有争议但发展前景好。

InfoQ
产品应用7

Nano Banana Pro或将引爆新安全危机

基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制力提升。它展现出复杂推理力,理解反光、推理指纹,但这或带来隐私危机。

AI工程化
新闻资讯7

朱啸虎投的第一个AI硬件公司,又完成一轮融资

AI眼镜创业公司Gyges Labs完成Pre A+轮融资,此前由朱啸虎的金沙江创投领投。其CEO邓旭东提出“Glass First”理念,以自研技术DigiWindow实现极致外观,还以“功减法”换“体验加法”,未来将布局可穿戴设备。

量子位
算法论文8

韩松等提出FlashMoBA,比MoBA快7.4倍,序列扩到512K也不会溢出

今年2月月之暗面提出MoBA,在处理长上下文有潜力,但业界缺乏对其性设计原则的理解和高效GPU实现。来自MIT、NVIDIA的研究者提出FlashMoBA,解决了小块MoBA性挑战,实验显示其在多方面表现优。

机器之心