AI Accelerator Design · All levels

AI Accelerator Metrics Reference

Core metrics for throughput, latency, quality, utilization, and sustained silicon efficiency.

Core metric families

  • Throughput and latency: tokens/s or inferences/s plus p95/p99 tails.

  • Utilization: compute occupancy, tensor-core or array fill efficiency.

  • Memory: bandwidth efficiency, reuse ratio, and stall fractions.

  • Quality: accuracy or loss movement under precision and scheduling changes.

  • Silicon: perf-per-watt, thermal throttle duty cycle, and frequency residency.

diagram
BANDWIDTH LENS - AI Accelerator closure

working-set pressure
  ^
  |                saturation zone
  |          ----------------------------
  |      o   unstable tail latency
  |   o      tuning candidate
  | o        baseline behavior
  +-------------------------------------> optimization iteration

Primary metric tracked:
throughput / p99 / perf-per-watt