BigHugger
sk Skill · di37

eval-surfer

Drive AI application evaluations using the EvalSurfer skill-first workflow. Use when creating AI eval rubrics, reviewing RAG outputs, checking agent tool use, assessing safety, or calculating operational metrics like latency, TTFT, inter-token latency, throughput (tokens per second), P99 tail latency, cost, cost per million tokens, token efficiency, failure rate, and latency under load.

installs 8w
0
30-day movement
starts with the next reading
Related entries
2
Connections
0
pythonmarkdownbashPython
Host repository
di37/EvalSurfer
Host stars
11
Host language
Python