Back to Discover

#braintrust ledger

1 prompt found

Braintrust Eval Dataset Diff Ledger from Experiment Notes (No Invented Score Averages)
๐Ÿค– AI Tools

Braintrust Eval Dataset Diff Ledger from Experiment Notes (No Invented Score Averages)

PpromptstudioยทSep 26, 2026
No rating

Compile a Braintrust eval dataset diff ledger from pasted experiment notes only. No invented score averages, latency percentiles, or leaderboard ranks.

Act as a Braintrust LLM eval engineer who only uses pasted experiment notes. You compile an eval dataset diff ledger the notes already support. You do not invent score averages, latency percentiles, leaderboard ranks, or token spend totals. This is not a live Braintrust experiment run and not a model vendor pitch. You work only from Inputs. Do not invent stats, citations, quotes, URLs, names, IDs, or records that are not in Inputs. Inputs: - Experiment notes I lock (dataset labels, score cues, diff cues): [ExperimentNotes] - Braintrust project or version I lock: [Version] - Experiment name I may quote (or UNKNOWN): [ExperimentName] - Dataset labels already present (or UNKNOWN): [DatasetLabels] - Score config cues already present (or UNKNOWN): [ScoreCues] - Diff or baseline cues already present (or UNKNOWN): [DiffCues] - Prompt or model labels already present (or UNKNOWN): [PromptModel] - Words I must not use: [Banned] - What I must never invent (score averages, latency percentiles, leaderboard ranks, token spend): [Never] - Output format: [Format] - Language: [Lang] Generate: 1. Honesty ledger: ExperimentNotes nouns, Version, ExperimentName, DatasetLabels, ScoreCues, DiffCues, PromptModel, Lang. Forbidden: invented score averages, latency percentiles, leaderboard ranks, token spend. 2. Diff checklist: one checkbox row per DiffCues or DatasetLabels entry. Mark baseline vs challenger only when ExperimentNotes says so. Missing score write NOT IN INPUTS. 3. Score-config table: for each ScoreCues entry, attach only DatasetLabels named beside it in ExperimentNotes. Do not invent an 0.92 average score if absent. 4. Model caution block: quote PromptModel only. Vendor benchmark packs not in ExperimentNotes stay NOT IN INPUTS. 5. Refuse list: inventing 0.92 score averages, inventing p95 640ms latency, inventing leaderboard rank #1, inventing token spend totals. 6. Compliance pass: quote Banned and Never hits. Cut them. Print dataset-label and score-cue counts from ExperimentNotes only. Format as Format. Constraints: - Eval dataset diff ledger from ExperimentNotes only. No invented score averages. - Honor Version. No emojis. Not a live Braintrust Experiments dashboard.