「多视图输入」共找到 4254 篇相关文章
谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建
字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。
百度搜索 10 年来最大改版,支持超千字长文本输入和 MCP 调用
7月2日,百度搜索宣布十年来最大改版,搜索框变“智能框”,支持超千字输入,集成AI写作等功能。“百看”功能、AI助手升级,接入视频生成模型MuseSteamer,还接入1.8万+MCP,提升搜索体验。
最具争议性研究:大模型中间层输出可 100% 反推原始输入
意大利罗马第一大学GLADIA Research Lab论文提出主流Transformer语言模型信息处理几乎不丢内容,是可逆的。实验验证其单射性,SIPIT算法能100%重建输入。研究有新视角,但也引发讨论。
MIT和加州联手打造多智能体大语言模型的金融交易框架TradingAgents
MIT和加州联手打造多智能体大语言模型的金融交易框架TradingAgents,将交易任务分解为专业角色,含分析师、研究员等。介绍了安装、CLI使用、包的实现细节等,还提及项目地址。
6小时复刻AI IMO金牌成果,蚂蚁多智能体新进展已开源
2025年IMO赛场,顶尖大模型起初表现不佳后有突破。蚂蚁AWorld项目团队6小时复现并开源DeepMind解题结果,给出可一键运行系统。AWorld证明多智能体协同优势,还介绍复现思路、核心优势及体验方式。
深入解析多邻国的 FinOps 之旅:将云支出转化为工程洞察
多邻国在《每位工程师都该了解的 FinOps》中分享实践经验,将财务意识融入工程流程,用成本可视化机制让开发者了解成本影响,采用相关指标平衡创新与效率,借助工具优化成本,行业正从‘削减成本’转向‘数据驱动责任制’。
物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界
WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。
达摩院推出多智能体框架ReasonMed,打造医学推理数据生成新范式
在人工智能领域,推理语言模型在医学场景应用存在挑战,达摩院推出多智能体框架ReasonMed,提出医学推理数据生成新范式,开源百万级高质量数据集ReasonMed370K,验证了‘小模型 + 高质量数据’的潜力。
PaddleOCR 3.0发布:OCR精度跃升13%,支持多语种、手写体与高精度文档解析
2025年5月20日,飞桨团队发布并开源PaddleOCR 3.0,适配飞桨框架3.0正式版。其提升文字识别精度,支持多文字类型和手写体识别,满足复杂文档解析需求,结合文心大模型4.5 Turbo提升关键信息抽取精度,还新增国产硬件支持。
腾讯广泛使用的跨端开发框架——Kuikly在搜狗输入法中的AI Coding实践
AI 席卷开发领域,输入法团队在 Kuikly 跨端项目探索 AI 工程化方案。介绍了推进 AI 友好型工程、构建精准 AIContext 等关键层面,以灵感词库页面开发为例展示效果,还展望了未来探索方向。