「视觉逻辑排版」共找到 1045 篇相关文章
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。
豆包大模型 Seed 2.0,有点不一样
大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。
最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26
多模态大语言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。
人形机器人市场,电池厂商看不上|甲子光年
市场认为人形机器人会成动力电池厂商‘第三增长极’,但厂商却不看好。因该市场规模小、无标准、研发成本高、利润低,且机器人续航差、商业逻辑不明,提前布局回报难测,对厂商是赔本买卖。
迟到3个月的美图Agent,RoboNeo居然有一些惊喜?
美图公司推出专注影像与设计的AI智能体RoboNeo,虽来得有点迟,但实战测评中它和星流Agent各有优劣。星流是光影与排版“偏科生”,RoboNeo是细节与执行“实干派”,适配不同需求。
AI胡说八道这事,终于有人管了?
AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类器超现有基准,还能识别逻辑错误,团队已公开数据集。
深圳SEO&GEO大会:搜索没死,只是竞争规则变了!
深圳SEO&GEO大会探讨搜索新形势,多位嘉宾分享见解。如Zac老师认为AI增长不代表搜索失价值,SEO应随搜索逻辑升级;Paul老师提出大品牌应将SEO目标转向争答案席位等。
AAAI 2026杰出论文奖 | ReconVLA:具身智能研究首次获得AI顶级会议最佳论文奖
具身智能常被视为‘系统工程驱动’研究方向,ReconVLA获AAAI杰出论文奖,是具身智能方向首次获AI顶级会议最佳论文。它解决VLA模型关键瓶颈,通过重建式隐式视觉定位机制,实验效果显著。
从「偶然发现」走向「必然创造」:AI如何重塑生物制造全链路?
2026年1月9日“第四届合成生物学及生物制造大会”上,深圳瑞德林李加忠指出AI4S驱动合成生物学变革,从“经验驱动”变为“数据与逻辑驱动”,并分享瑞德林通过AI4S重塑生物制造全链路的实践。