wwsun
Search
搜索
暗色模式
亮色模式
阅读模式
探索
benchmark
此标签下有10条笔记。
2026年9月20日
LLM Benchmark——如何衡量一个模型有多强
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 5 章:智能体与效率基准——从「答题」到「干活」
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 3 章:竞技场与人类偏好——让用户当裁判
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 4 章:基准的陷阱——污染、饱和与 Goodhart 定律
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 2 章:考试式基准——用考卷丈量知识与能力
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 6 章:如何读榜与自测——在噪声中做决定
learning
llm-benchmark
llm
benchmark
2026年9月20日
第 1 章:为什么需要评测——给黑箱打分
learning
llm-benchmark
llm
benchmark
2026年9月20日
PinchBench
llm
agent
benchmark
2026年8月02日
DeepSeek V4 Flash 0731 — 智能、性能与价格分析
ai-model
deepseek
benchmark
clippings
2026年7月22日
Kimi K3 与鹈鹕基准测试的启示
clippings
llm
benchmark
ai-model