标签: NIST

清除筛选

CAISI 评估 DeepSeek V4 Pro:综合能力落后美国前沿约 8 个月

NIST 下属人工智能标准与创新中心(CAISI)发布了对 DeepSeek V4 Pro 的评估报告。结论:DeepSeek V4 Pro 是 CAISI 迄今评估的最强中国 AI 模型,但综合能力比美国前沿模型落后约 8 个月。 核心结论 CAISI 使用了受项目反应理论(IRT)启发的聚合评估方法,在网络安全、软件工程、自然科学、抽象推理和数学五个领域…

AIDeepSeekNIST