「半监督评测体系」共找到 1306 篇相关文章
李想重画具身智能
理想汽车在成立的十一年里,擅长将复杂技术与家庭出行需求对齐。2026年,理想不再满足于打造更好的家庭车,提出造能感知、思考、行动、反馈的硅基生命体。李想提出具身智能上下半场论,理想重构研发体系,以造人方式造车。
5Y News | AI-native投资管理公司GIM完成数千万美元A轮融资
近日,AI-native智能投资管理公司GIM完成A轮数千万美元融资,由弘毅投资旗下金涌投资和B Capital联合领投。公司沿着垂域大模型和自进化智能体系统两条主线建设资管基础设施,已进入实战阶段。
比 Playwright 更给力,这个新开源的项目6啊~
GitHub上的BrowserAct项目是面向AI Agent的浏览器自动化CLI,是为AI Agent设计的真实浏览器执行层。它有三层反检测突破体系、三种浏览器模式等功能,能解决Agent操作浏览器的诸多问题,适合多场景。
Harness Engineering:耗时一周,我是如何将应用的AI Coding率提升至90%的
文章结合Anthropic、OpenAI方法论与项目实践,分享为存量Java应用构建Harness体系,将AI代码率从不到25%提至90%的方法。介绍Harness概念、现状挑战、实战步骤、关键经验及效果,还对其未来发展做了展望。
AI 时代的架构治理
本文指出在生成式AI时代,软件开发生命周期瓶颈转变为组织将创意转化为成果并保持架构凝聚力的能力。传统人工监督模式难应对,提出声明式架构策略,介绍其在事件模型、OpenAPI验证器等方面应用。
刚刚,百度最新开源神作:PaddleOCR-VL-1.5上线了
1月29日百度开源新一代文档解析模型PaddleOCR-VL-1.5,参数仅0.9B,在OmniDocBench V1.5评测中综合性能全球第一,精度达94.5%。它支持异形框定位,解决真实文档解析难题,在多场景表现出色。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
从Demo到行业落地的Agents:技术、应用与评估
通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。
CSDN 创始人蒋涛:中国开源十年突围路、模型大战阿里反超 Meta,数据解析全球开源 AI 新进展
在GOSIM HANGZHOU 2025现场,CSDN创始人蒋涛发布两份报告。《2025全球开源发展报告(预览版)》显示美主导、中国崛起;《大模型技术体系开源影响力榜单》中,Meta、阿里等表现突出,强调大模型竞争关键在生态。
全球首个从语言出发构建的智能体:MoonBit Pilot 如何推动自动化软件交付?
MoonBit Pilot是从语言底层构建的代码智能体系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。