Skip to main content

Eval & Observability

Real telemetry from every model call.

FrictionLens scores app reviews across five sentiment dimensions using Gemini. This page shows the eval intuition layer behind that pipeline — Spearman correlation per dimension against a hand-labeled golden set, plus real cost, latency, and reliability metrics from production traffic.

Calls (30d)
0
Total model invocations
Spend (30d)
$0.00
Sum of input + output cost
p95 latency
0ms
Weighted by call volume
Error rate
0.0%
0 errors · 0 rate-limited

Cost by model

Total USD across last 30 days

No calls in the last 30 days.

Latency by prompt

p50 / p95 / p99 across last 30 days

No calls in the last 30 days.

Latest eval run

Spearman correlation per dimension vs. hand-labeled golden set

Prompt
review-v1
Model
gemini-2.5-flash
n
19 reviews · golden vv1
Date
2026-05-14
DimensionSpearman ρMAE (0–10 scale)Verdict
love0.9460.63strong
frustration0.9510.95strong
loyalty0.9710.68strong
momentum0.9120.89strong
wom0.9870.37strong
Churn-risk exact-match: 68%run 1ed3bd0e

Prompt registry

Deployed prompts with version, call volume, and last-deployed date

Prompt IDNameVersionCalls (30d)DeployedNotes
report-v1reportv102026-05-13Initial aggregate Vibe Report synthesis prompt.
review-v1reviewv102026-05-13Initial scoring rubric for single-review analysis.
batch-review-v1batch_reviewv102026-05-13Same rubric as review-v1, applied across a batch of reviews.
report-v2reportv202026-05-13Adds verdict, the_one_thing, citations, confidence, wishlist/dealbreaker bucketing, vagueness rejection, de-duplication.
report-v3reportv302026-05-14Adds strict review-ID binding: cited_review_ids must use only the rNNN IDs supplied, never invented. Enables the click-to-see-receipts UI.
report-v4reportv402026-07-12Adds topic continuity: reuse the baseline analysis's friction/churn topic names verbatim so period-over-period deltas pair the same topic instead of naming drift.
report-v5reportv502026-07-12Topic continuity v2: v4's buried instruction was ignored live (0/10 topics reused). Moves the topic list to the TOP of the user prompt, adds a reinforcement at the produce-list decision point, and hardens the system rule.

Recent traces

Last 20 model calls (anonymized — no user identifiers)

WhenPromptModelTokens (in / out)LatencyCostSourceStatus
58d agobatch-review-v1gemini-3.1-flash-lite6956 / 785617360ms$0.0135success
58d agobatch-review-v1gemini-3.1-flash-lite7890 / 728617114ms$0.0129success
58d agobatch-review-v1gemini-3.1-flash-lite865 / 3461398ms$0.0007success
58d agoreview-v1gemini-3.1-flash-lite773 / 1891208ms$0.0005success
58d agobatch-review-v1gemini-3.1-flash-lite829 / 2241106ms$0.0005success
58d agoreview-v1gemini-3.1-flash-lite773 / 1891349ms$0.0005success
59d agoreport-v5gemini-2.5-flash-lite5179 / 200411890ms$0.0013report_apisuccess
59d agobatch-review-v1gemini-2.5-flash-lite4165 / 655551199ms$0.0030success
59d agoreport-v5gemini-2.5-flash-lite / 9247mspipelinerate_limit
59d agobatch-review-v1gemini-2.5-flash-lite4905 / 680920506ms$0.0032pipelinesuccess
59d agobatch-review-v1gemini-2.5-flash-lite10046 / 1374339737ms$0.0065pipelinesuccess
59d agoreport-v5gemini-2.5-flash-lite / 12254mspipelinerate_limit
59d agobatch-review-v1gemini-2.5-flash-lite7321 / 1009726626ms$0.0048pipelinesuccess
59d agobatch-review-v1gemini-2.5-flash-lite9527 / 1320932112ms$0.0062pipelinesuccess
59d agobatch-review-v1gemini-2.5-flash-lite / 42461mspipelineerror
59d agoreport-v5gemini-2.5-flash-lite / 11118mspipelinerate_limit
59d agobatch-review-v1gemini-2.5-flash-lite7321 / 1013031789ms$0.0048pipelinesuccess
59d agobatch-review-v1gemini-2.5-flash-lite8556 / 1364538311ms$0.0063pipelinesuccess
60d agobatch-review-v1gemini-2.5-flash-lite / 6326mspipelinerate_limit
60d agobatch-review-v1gemini-2.5-flash-lite / 30657mspipelinerate_limit