wwsun

benchmark

此标签下有10条笔记。

  • 2026年9月20日

    LLM Benchmark——如何衡量一个模型有多强

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 5 章:智能体与效率基准——从「答题」到「干活」

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 3 章:竞技场与人类偏好——让用户当裁判

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 4 章:基准的陷阱——污染、饱和与 Goodhart 定律

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 2 章:考试式基准——用考卷丈量知识与能力

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 6 章:如何读榜与自测——在噪声中做决定

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    第 1 章:为什么需要评测——给黑箱打分

    • learning
    • llm-benchmark
    • llm
    • benchmark
  • 2026年9月20日

    PinchBench

    • llm
    • agent
    • benchmark
  • 2026年8月02日

    DeepSeek V4 Flash 0731 — 智能、性能与价格分析

    • ai-model
    • deepseek
    • benchmark
    • clippings
  • 2026年7月22日

    Kimi K3 与鹈鹕基准测试的启示

    • clippings
    • llm
    • benchmark
    • ai-model

Created with Quartz v5.0.0 © 2026

  • GitHub
  • RSS