视觉推理功能」共找到 3991 篇相关文章

产品应用8

把短视频做成流水线的AI剪辑神器

Pixelle-Video是一款AI剪辑神器,输入主题就能自动完成视频创作,零门槛。它采用模块化设计,流程清晰,各环节可灵活定制。支持多种AI模型、TTS方案,有丰富功能亮点。

GitHubStore
算法论文8

AdaGen: 让图像生成模型学会自适应策略

当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。

机器之心
开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
新闻资讯7

融资千万的 Violoop ,要做中国版的「硬件龙虾」

AI科技公司Violoop创始人何佳霖,想做中国版“硬件龙虾”,让AI 24小时为人类打工。其产品是手掌大小桌面硬件,3月12日完成数千万元融资,将用于产品落地等。团队最初尝试纯软件路线,后因安全等问题转向硬件。

AI科技评论
算法论文8

视频生成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键

自回归视频生成模型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。

量子位
开源动态7

这个 AI 股票分析项目,居然快 2w star了?!

A股行情火热,盯盘分析耗时耗力。Github上的开源项目`daily_stock_analysis`基于AI大模型构建,能自动分析股票行情等,生成“AI决策仪表盘”,给出投资参考建议,目前已获18.1k+ Star。

开源先锋
产品应用8

小鹏加速冲向L4终局:对VLA架构「动刀」成关键一环

在辅助驾驶领域,端到端的VLA方法虽有效果,但面临中间层语言难以准确表达物理世界细节的问题。小鹏汽车去掉“语言转译”环节,推出第二代VLA,有跨代级驾驶体验,背后是底层技术架构重构。

机器之心
新闻资讯8

OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了

OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。

新智元
算法论文7

多智能体大语言模型中的人类自适应协作

尽管大语言模型有进展,但纯自治多智能体系统有局限。为此提出 HILA 框架及双环策略优化机制,结合 DLPO 的 HILA 在基准测试中表现出色,为构建 Agentic 系统提供指导。

深度学习自然语言处理
产品应用7

别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结

本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。

阿里云开发者