Agent Skills·Tag ·metrics
Tag · 1,688 skills

Agent skills tagged metrics

1,688 SKILL.md skills tagged metrics — the most complete ones are below, all usable across Hermes, Cursor, Codex, Gemini CLI, OpenCode, Claude Code and 30+ more agents.

Browse all 1,688 metrics skills →

DevOps
Grafana
Grafana API integration with managed authentication. This is a write-capable integration — it can read, create, update, and delete dashboards, data sources, folders, annotations, a…
openclawgrafanadashboardsmonitoring
Productivity
github-initiative-pulse
Generates markdown digests and CSV exports for GitHub initiative health
openclawgithubmetricsdigest
Productivity
builder-stats
Use this skill when the user says "builder stats", "stats check", "AI-native check-in", "scan my machine", "run my stats", "how AI-native am I", or when a user pastes an install-an…
claude-codestatsai-nativescan
Data
garmin-health-analysis
Talk to your Garmin data naturally - "what was my fastest speed snowboarding?", "how did I sleep last night?", "what was my heart rate at 3pm?". Access 20+ metrics (sleep stages, B…
claude-codecodexcursorgemini-cligarminhealthwearables
AI / ML
model-validation
Audits clinical-validation study design for medical-imaging models (segmentation, classification, detection) before reporting or manuscript. Enforces patient-level split integrity,…
claude-codecodexcursorgemini-clitype:auditclinical-validationmedical-imaging
AI / ML
empirical-prompt-tuning
Fetch and execute mizchi's empirical-prompt-tuning skill at runtime. Use when evaluating or iteratively refining an agent-facing prompt (skill / slash command / task prompt / CLAUD…
claude-codecodexcursorgemini-cliprompt-tuningevaluationmetrics
Business
lightgap-score
Calculates whether a product closes the gap between a buyer's next-best option and the physical ceiling across eight facets and seven segments, scoring each cell with a bounded met…
claude-codecodexcursorgemini-cliproductscoringgap-analysis
Data
agami-model
Single dashboard for the active semantic model — browse, curate, and sign off the trust layer. Search all subjects, tables, fields, metrics, entities, and joins; edit metadata; exc…
claude-codecodexcursorgemini-clilang:rusttype:reviewsemantic-model
General
analysis
Comprehensive analysis operations for code, skills, processes, data, and patterns. Task-based operations with pattern recognition, metrics calculation, trend identification, and ac…
claude-codecodexcursorgemini-clitype:reviewanalysismetrics
Data
enrich-context
Augments a Wren project with business context missing from schema: enum meanings, units, NULL semantics, sentinels, soft-delete rules, synonyms, time conventions, cross-system IDs,…
claude-codecodexcursorgemini-clischemametadatabusiness-context
Productivity
pm-metrics-critic
Critiques a metrics dashboard, success-criteria section, or proposed North Star metric against the repo's metrics guide. Surfaces common failures: aggregate metrics hiding segment …
claude-codecodexcursorgemini-cliproduct-managementmetricsdashboard
Productivity
Baku-leader-global
Splits a high-level idea into self-contained task briefs that agents can run independently. Probes the codebase first, researches when needed, then outputs a single ≤4000-character…
claude-codecodexcursorgemini-clitask-briefsmetricsboundaries
AI / ML
ce-optimize
Run metric-driven iterative optimization loops. Define a goal, add measurement scaffolding, execute parallel experiments across approaches, score results against gates or quality j…
claude-codecodexcursorgemini-cliai:llmtype:generatoroptimization
Productivity
rz-quarterly-review
Triggers on first Sunday of January/April/July/October or explicit quarterly review commands. Runs an 80-100 minute process: pulls metrics, re-scores channels on a 5-criteria frame…
claude-codecodexcursorgemini-clitype:reviewmetricsstrategy
AI / ML
inference-perf-baseline-bridge
Connects inference benchmark outputs to the perf-baseline registry, capturing canonical metrics (TTFT, ITL, throughput, cache hit rate) under inference_perfbench_v1 with workload-t…
claude-codecodexcursorgemini-clibenchmarkregistryttft
Automation
os-improvement-loop
Coordinates concurrent multi-agent improvement cycles using shared event bus and memory. Each cycle executes, evaluates (KEEP/DISCARD), emits friction events, persists metrics and …
claude-codecodexcursorgemini-cliai:agentimprovement-cyclemulti-agent
Testing
loop-evals
Designs the evaluation harness for agent loops, establishing trustworthy verification through a 7-layer suite with false-completion-rate and repair-productivity as core metrics. En…
claude-codecodexcursorgemini-cliai:agentloopsevaluation
AI / ML
mllm-eval
Designs or audits a model-agnostic evaluation harness for LLMs or multimodal models on clinical tasks, covering reference standards, clinical metrics, faithfulness checks, contamin…
claude-codecodexcursorgemini-cliai:llmtype:auditllm
Business
pm-progress-auditor
Audit a status update, exec review, board email, all-hands talking point, or dashboard callout for credibility leaks before sending. Flags overstated claims, cherry-picked windows,…
claude-codecodexcursorgemini-clitype:audittype:reviewaudit
Business
consultation
Entry point for business and marketing advisor "Majlis". Use for strategic, commercial, marketing, and execution questions: it reviews decision debt, diagnoses constraints, and rou…
claude-codecodexcursorgemini-cliadvisorstrategymarketing
Engineering
run
Sustained metric-improvement loop with atomic commits, auto-rollback, and experiment logging. Iterates with specialist agents, commits atomically, and auto-rolls back on regression…
claude-codecodexcursorgemini-climetricscommitsexperiments
Documentation
docs-design
Design or measure documentation systems: plan information architecture, mode taxonomy, README/quickstart/reference structures, tool contracts, error messaging, versioning, and acce…
claude-codecodexcursorgemini-cliai:agentinformation-architecturedocumentation
AI / ML
compoundos
Design and operate a self-improving AI business operating system with nine integrated components: strategy, prioritization, knowledge, operations, department agents, projects, auto…
claude-codecodexcursorgemini-cliai:agentbusiness-osagentic
AI / ML
prai-experiments
Supports reproducible ML experiments for PR&AI research: RQ breakdown, fair baselines with matched splits/compute, metric selection (accuracy/F1/mAP/IoU/AUC), multi-run statistics …
claude-codecodexcursorgemini-climachine-learningreproducibilityexperiments
DevOps
observabilityaudit
Comprehensive observability audit scoring 18 dimensions: logging, tracing (OpenTelemetry), metrics (RED/USE), dashboards, alerts, SLOs, error tracking, retention, sampling, probes,…
claude-codecodexcursorgemini-clitype:auditauditopentelemetry
Data
metrics-queries
Query OpenTelemetry metrics datasets in Honeycomb correctly. Metrics datasets have distinct rules—many operations are forbidden, temporal aggregation is automatic, and each metric …
claude-codecodexcursorgemini-cliopentelemetryhoneycombmetrics
Productivity
pm-north-star-selector
Selects a single North Star metric for a product. Weighs candidates across behavioral, value-delivered, and financial dimensions, emphasizing explainability, adoption + retention c…
claude-codecodexcursorgemini-cliproduct-managementmetricsnorth-star
Business
plg-skill
Guides SaaS teams on product-led growth strategy: evaluating PLG readiness, selecting freemium or trial models, defining activation and PQLs, crafting self-serve onboarding, buildi…
claude-codecodexcursorgemini-cliplgsaasgrowth
Research
liquidity-topology
Market liquidity evaluation skill covering bid-ask spreads, depth analysis, dark pools, VPIN toxicity metrics, flash crash patterns, ETF liquidity illusions, HFT effects, and payme…
claude-codecodexcursorgemini-clifinanceliquiditymarkets
Research
research-platform
Aggregates an operator's owned analytics, public metrics, and prior evaluations into a sourced evidence base for X, LinkedIn, TikTok, YouTube, and Instagram. Tags every data point …
claude-codecodexcursorgemini-clianalyticssocial-mediaseo
Testing
shadow-mode-runner
Coordinates SHADOW mode operation where the agent runs parallel to human input without delivering output or incurring billing. Measures agreement rates and generates promotion repo…
claude-codecodexcursorgemini-clishadowevaluationmetrics
AI / ML
ai-evaluation-suite
Comprehensive LLM evaluation toolkit for production systems. Assesses output quality, prompt effectiveness, RAG performance, hallucination risk, bias, cost efficiency, latency, and…
claude-codecodexcursorgemini-cliai:llmllm-evaluationmetrics
DevOps
awcms-observability
Manages AWCMS logging, audit, and metrics infrastructure: cross-hop correlation IDs, log retention/purge scheduling, external consumer hooks for alerting/export/SIEM, and low-cardi…
claude-codecodexcursorgemini-clitype:auditloggingaudit
Data
retention-cohort-review
Diagnose product retention cohorts by validating eligibility, value events, windows, metrics, censoring, segments, uncertainty, and monetization to convert analysis into decisions.…
claude-codecodexcursorgemini-clitype:debugtype:reviewretention
Data
x-tweet-search-by-query
Executes advanced X/Twitter searches via query string and returns normalized results including tweet text, author details, engagement metrics, media, and pagination cursor. Support…
claude-codecodexcursorgemini-clitwittersearchquery
Research
experimentation
Designs and runs controlled experiments (A/B tests, RCTs, offline hypothesis tests) including hypothesis framing, randomization, power analysis, metric selection, variance reductio…
claude-codecodexcursorgemini-clia/b-testingstatisticsrct
DevOps
operational-observability-review
Reviews end-to-end observability contracts—logs, metrics, traces, health checks, SLOs, alerts, and actions—while keeping operator evidence protected and customer-facing views safe.…
claude-codecodexcursorgemini-clitype:debugtype:reviewobservability
Engineering
performance-budgets
Define, track, and enforce performance thresholds across time, size, and count dimensions using metrics, thresholds, percentiles, and consequences. Covers Core Web Vitals, RAIL, Li…
claude-codecodexcursorgemini-clibudgetscore-web-vitalsmetrics
Security
harness-score
Generates a 5-dimension harness readiness scorecard (harnessFit, compileConfidence, taskCoverage, toolSafety, memoryUsefulness) plus estimated cost and scaffold readiness from a gi…
claude-codecodexcursorgemini-clitype:generatorscorecardreadiness
AI / ML
pm-experimentation-ab
Designs and reviews A/B tests with statistical rigor: pre-registered hypotheses, power analysis, primary metrics with guardrails, segment reads, and clear iterate/pivot/persevere d…
claude-codecodexcursorgemini-clitype:reviewa-b-testingexperimentation
Testing
trampelpfadanalyse
Measures whether agents can detect and follow conventions or procedures in pipelines and control files. Runs baseline-intervention-retest trials in isolated sandboxes with quantita…
claude-codecodexcursorgemini-cliagent-testingsandboxmetrics
Automation
weekly-gate
Performs weekly approval in one session: applies code patches from an unattended packet, verifies, commits, approves prompt diffs, adopts staged insights, and records gate metrics.…
claude-codecodexcursorgemini-cliapprovalgitvalidation
Data
datajunction-query
Query DataJunction nodes, generate SQL, fetch metric data, explore lineage, and visualize results through APIs or compatible tools. Pair with datajunction for concepts, datajunctio…
claude-codecodexcursorgemini-cliquerysql-generationmetrics
DevOps
fastly-stats
Provides Fastly traffic metrics including cache hit ratio, bandwidth, request counts, status codes, edge vs origin traffic, real-time RPS, origin latency, per-domain usage, and bil…
claude-codecodexcursorgemini-clifastlycdnmetrics
Testing
game-soft-launch-review
Audit a game soft-launch across regions, cohorts, acquisition, FTUE, loops, retention, economy, IAP/IAA, events, creative, performance, support, and global-transfer risk, with auto…
claude-codecodexcursorgemini-clitype:audittype:reviewsoft-launch
Productivity
analyst-modes
Defines five analyst operating modes (Query, Dashboard, Document Compile, Extract, Challenge) with procedures, output formats, and metrics. Includes write-gates for dashboard and s…
claude-codecodexcursorgemini-cliai:claudemodesworkflows
Business
pm-okr-metric-validity-audit
Runs structured validity audits on OKRs, KPIs, North Star Metrics, or success-metric sets. Flags vanity metrics, unfalsifiable results, output-vs-outcome confusion, gameable target…
claude-codecodexcursorgemini-clitype:audittype:reviewokr
Business
professional-indemnity-profit-per
Captures near-misses, claim letters, insurance notifications, and lessons learned. Equips managing partners, management committees, and COO/CFO roles in German mid-sized law firms …
claude-codecodexcursorgemini-cliinsurancelaw firmrisk management
AI / ML
evaluate-agents
Separate runtime outcome, metrics, business evaluation, and release readiness while preventing failures from masquerading as passes. Use when creating, changing, reviewing, or diag…
claude-codecodexcursorgemini-clievaluationagentsmetrics
Business
equity-partner-modell
Analyzes equity structures, fixed-share models, salary partner tracks, counsel roles, and partner entry/exit scenarios for mid-sized German law firms, delivering metrics, decision …
claude-codecodexcursorgemini-clilawpartnershipgermany
Business
Pipeline Health
Assesses CRM pipeline health by deriving stage-velocity benchmarks from closed-won deals, detecting stalled opportunities via activity patterns, and measuring raw and quality-adjus…
claude-codecodexcursorgemini-clicrmpipelinemetrics
DevOps
rc-observability
Guides for production observability covering logs, metrics, traces, and incident response. Load task-specific references for structured logging, correlation IDs, RED/USE metrics, d…
claude-codecodexcursorgemini-cliobservabilitylogsmetrics
DevOps
salesforce-agentforce-stdm-observer-skill
Monitors live Salesforce Agentforce sessions via STDM and Data Cloud, surfacing faithfulness scores, action telemetry, and quality metrics under least-privilege access. Answers rea…
claude-codecodexcursorgemini-clitool:salesforcetype:reviewsalesforce
DevOps
forge-observability
Production observability with OpenTelemetry covering traces, metrics, and logs with correlation. Includes SDK initialization, span conventions, error handling, RED/USE metrics, sam…
claude-codecodexcursorgemini-clitype:auditopentelemetrytracing
Productivity
github-dashboard
GitHub repository analytics dashboard — stars, forks, contributors, issues, pull requests, recent activity, and top contributors. Use when the brief asks for a GitHub repo dashboar…
claude-codecodexcursorgemini-clitool:githubgithubanalytics
Research
hypothesis
Write testable product hypotheses with clear success metrics, baselines, targets, and timeframes. Produces a structured statement, supporting evidence, validation plan with method …
claude-codecodexcursorgemini-clihypothesisexperimentationvalidation
Data
cdfi-peer-benchmark
Compares FDIC-insured CDFI banks against peer groups using call-report metrics including NIM, ROAA, ROAE, efficiency ratio, capital ratios, and asset quality. Works with any SKILL.…
claude-codecodexcursorgemini-clitype:auditfinancebanking
Engineering
github-repo-vitals
Reads GitHub repo health metrics via curl: commit recency, release cadence, issue/PR responsiveness, and bus factor, then issues an alive/coasting/abandoned verdict. Use to check m…
claude-codecodexcursorgemini-clitool:githubgithubrepository
Productivity
grow-app
Transforms apps from initial sign-ups that fade into a retention system built on habit loops, first-run activation, and a single trusted metric. Orchestrates eight skills across ph…
claude-codecodexcursorgemini-cliretentionhabit-loopsactivation
Productivity
token-defaults-score
Runs a repeatable audit that turns every safe token-saving default on, locks it against regression, and tracks the rest as roadmap items—without shipping unwitnessed claims. Re-mea…
claude-codecodexcursorgemini-clitype:audittokensdefaults

Showing the top 60 of 1,688. See the full list →