「视觉功能」共找到 2166 篇相关文章
医疗AI平台Abridge获3亿美元,估值53 亿美元
医疗AI平台Abridge获3亿美元E轮融资,估值达53亿美元。其利用AI为医疗场景服务,核心功能“环境监听”可生成临床笔记。目前超150家医疗系统使用,正拓展收入周期管理等业务。
孪生素数猜想被GPT-6新突破!北大数学07级又出现了
OpenAI发布数学论文,宣布GPT-6 Astra在孪生素数猜想上有新进展,用Lean形式化证明把连续素数间距的上界从246推到186。此外,其3D生成效果出色,Codex还新增可搜索笔记功能。
机器人看不清,蚂蚁给治好了
天下苦机器人看不清透明和反光物体久矣,问题出在深度相机。蚂蚁集团具身智能公司蚂蚁灵波开源深度视觉模型LingBot - Depth,无需换硬件,用创新算法和大量数据提升性能,还将开源数据集。
Bengio 15 年前论文再夺 AAAI 奖!AI 正告别单纯炫技,走向真实世界
全球人工智能顶会AAAI揭晓年度奖项,Yoshua Bengio 2011年论文获经典论文奖。今年5篇杰出论文研究方向指向AI从炫技走向应用,如ReconVLA改进VLA视觉感知,CADYT解决连续时间因果结构学习空白等。
CES 新爆款!追觅具身智能扫地机,打破「人形唯一论」
CES上,追觅具身智能扫地机成爆款,它打破“人形唯一论”,采用四足轮腿和双臂结构,能完成多种家务及养老关怀功能。它基于深厚积累且研发投入高,有望成家庭具身智能优选。
智谱AI发布桌面Agent,轻松训练 AI数字员工
智谱AI发布ComputerRL自主桌面智能框架,旨在让AI像人一样用电脑。它融合API与GUI,采用分布式训练,引入Entropulse解决探索衰减。在OSWorld测试中表现亮眼,虽有视觉感知等挑战,但意义重大。
GitHub上已突破5.1k stars!这是真正被开发者认可的 AI Agent平台,AI开发者必看,如何用它实现生产力逆袭?
TaskingAI是AI - native应用开发平台,整合多模块提供一站式BaaS体验,简化AI应用全流程。它支持多模型,有检索、工具插件等功能,适用于客服、销售等场景,还对比同类项目展现优势。
55.9K star!微软硬核开源文档转换神器,LLM最佳拍档!
介绍微软开源的轻量级Python文档转换工具MarkItDown,它支持20+格式智能转换为结构化Markdown,专为LLM文本分析场景优化,解决开发者处理多格式文档痛点,还阐述其功能、技术架构等内容。
Github 轻松斩获 30k+ Star,桌面应用开发太丝滑,Tauri框架能重塑桌面App开发?别错过,抓紧上车
Tauri是开源框架,用Rust后端和本地WebView,打造轻量、高性能、安全的跨平台应用,在GitHub获超30000 Star。它能解决Electron应用体积大、性能慢等痛点,功能亮点多,应用场景丰富。
大模型虽好,但恕我直言:在OCR面前,开源小模型更香
作者所在公司项目需处理大量纸质文档,起初考虑云端大模型API调用和开源大模型本地化部署,却因成本高、硬件要求高受阻。后经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。