模长感知」共找到 955 篇相关文章

新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化程任务能力是关键

Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言型训练奏效,如 Opus 4 能处理周期任务。还探讨型发展方向,如用户与多型交互、型可解释性等,认为未来会有白领 AI 员工。

Founder Park
产品应用7

Qoder @database功能上线!自动关联数据库 Schema,后端 AI Coding 效率拉满

Qoder JetBrains插件上线@database功能,将数据库能力内置为核心上下文,可一键让AI结合真实业务表结构处理SQL编写等任务。它是JetBrains上唯一深度支持“数据库原生感知”的AI Coding插件,还介绍了使用方法、场景及注意事项。

阿里云开发者
算法论文8

上下文记忆力媲美Genie3,且问世更早:港大和可灵提出场景一致的交互式视频世界

交互式视频生成缺乏稳定场景记忆,制约下游应用落地。Google DeepMind的Genie 3有强场景一致性但未公开技术细节。港大和可灵提出的Context as Memory型,上下文记忆力媲美Genie 3且投稿更早,还提升了计算效率。

机器之心
开源动态7

AI办公斩杀线,一页文档多少钱

腾讯混元Hy4 preview正式发布并开源,参数770B,是开源阵营里参数最大的Apache 2.0型。它能处理文本,官方定位有软件工程、办公分析等四个方向。还分析了处理一页文档的成本,指出办公AI下半场重在‘读懂’。

CourseAI
新闻资讯7

AI Agent 距离真正替人「全自动办公」,还有多远?

Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大型表现糟糕,智能体存在周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。

特工宇宙
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知

花叔
开源动态8

NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源

TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。

机器之心
产品应用8

真碾压Sora了!谷歌Veo 3首次实现音画同步,视频型直接「开口说话」

谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时和使用门槛限制,但已足够震撼。

机器之心
新闻资讯7

没了遥控器,还被扔进荒野,具身智能该「断奶」了

在第五届ATEC科技精英赛上,人形机器人在户外场景状况百出,如摔倒、罢工等。专家认为过去高估其通用能力,五年内走进家庭承担家务较难。具身智能面临感知、决策、硬件等难题,但也有队伍取得成果。

机器之心
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和型上验证有效,性能提升显著。

深度学习自然语言处理