评估问题」共找到 3739 篇相关文章

新闻资讯7

Anthropic "泄露"Claude Mythos 最强模型到底有多猛?

Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。

CourseAI
开源动态8

AI下半场的战场,从Agent记忆体正式打响

OpenClaw开源项目爆火,标志AI进入下半场走向真实应用。关键在于解决AI在现实中持续干活的问题,核心是Agent Memory。论文梳理该赛道,指出其是系统级记忆体结构框架,未来关键在memory策略可学习。

机器之心
开源动态8

Z-Image标准版开源:更具可塑性的图像生成全能基座

Z-Image标准版开源,它是为开发者准备的强大画板,解决了生成模型同质化问题。其保留完整权重,在微调、风格化上潜力大,采用创新架构,训练定位SFT阶段,有完整CFG支持,还提供完善工具链。

AIGC开放社区
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
产品应用7

Nano Banana 邪修之王最强科研成果!教你自定义生图比例!

Nano Banana 出图有分辨率低和比例不可控问题。作者发现用垫图方式可控制其生图比例,已生成图片也适用,还给出操作方法、提示词,介绍不同平台效果及案例图下载方式。

歸藏的AI工具箱
新闻资讯7

核心模型被曝蒸馏DeepSeek?前女友一纸控诉,曝出欧版OpenAI塌房真相!

曾被誉为「欧洲OpenAI」的Mistral AI陷入「抄袭」丑闻。前员工在分手小作文爆料其核心技术蒸馏DeepSeek,却误导外界为自主RL成果。此前也有博主发现二者特征相似。蒸馏本身没错,缺乏透明度才是关键问题

新智元
新闻资讯7

Docker Desktop 4.42 发布,带来原生 IPv6、集成的 MCP 工具包以及 AI 模型打包功能

Docker 公司发布 Docker Desktop 4.42 版本,增强网络灵活性、AI 工作流集成和模型分发功能,如新支持原生 IPv6、集成 MCP 工具包等。但 macOS 用户反馈稳定性下降,有启动、网络等问题

InfoQ
新闻资讯8

中国中文信息学会大模型与生成专委会2025大模型战略研讨会成功举办

2025年6月27日,中国中文信息学会大模型与生成专委会2025大模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦大模型多方面话题。

深度学习自然语言处理
新闻资讯7

腾讯打出「AI岗位薪酬不限」的底气来自哪?

毕业季AI专业毕业生择业有疑虑,AI下半场竞争重心转移。腾讯覆盖领域广、业务耦合强、有变现案例,契合AI下半场人才成长环境,其青云计划“薪酬上不封顶”,今年筛选标准升级。

机器之心
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营