---
id: 20260801-T0-13
title: "smevals：轻量评测套件，快速对比模型、提示词与框架"
title_en: "smevals: A Small Eval Suite for Models, Prompts, and Harnesses"
url: https://ai.daily.yangsir.net/daily/20260801-T0-13
issue_date: 2026-08-01
publish_date: 2026-07-31T21:15:23.000Z
category: tools
source_name: "Simon Willison"
source_url: https://simonwillison.net/2026/Jul/31/smevals/#atom-everything
---

# smevals：轻量评测套件，快速对比模型、提示词与框架

Simon Willison与Prime Radiant实验室合作推出smevals，一个轻量评测套件，用于评估和对比不同模型的性能、提示词策略及评测框架本身。它旨在快速回答“哪个模型/提示词在我的场景中表现更好”的问题。开发者可将其集成到工作流中，对候选模型和提示词进行低成本AB测试，替代手动逐条验证。

## English Version

**smevals: A Small Eval Suite for Models, Prompts, and Harnesses**

Simon Willison collaborated with Prime Radiant's lab to release smevals, a minimal eval suite for comparing models, prompts, and evaluation harnesses. It targets the practical question: which configuration performs better in my scenario? Developers can run low-cost A/B tests across models and prompts without boilerplate—a handy tool for routine quality checks.

---

**来源**：[Simon Willison](https://simonwillison.net/2026/Jul/31/smevals/#atom-everything)

**详情页**：https://ai.daily.yangsir.net/daily/20260801-T0-13

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*