简体中文
外观
227 字小于 1 分钟
domain/aiai/llm
2026-07-24
Benchmark:标准化的模型评测数据集和评估方法 Human Eval:基于人类评判的模型质量评估 A/B 测试:在线对比不同模型效果的方法 Red Teaming:通过对抗性测试发现模型安全漏洞