Hugging Face's logo Hugging Face
  • Models
  • Datasets
  • Spaces
  • Buckets new
  • Docs
  • Enterprise
  • Pricing
    • Website
      • Tasks
      • HuggingChat
      • Collections
      • Languages
      • Organizations
    • Community
      • Blog
      • Posts
      • Daily Papers
      • Hardware
      • Learn
      • Discord
      • Forum
      • GitHub
    • Solutions
      • Team & Enterprise
      • Hugging Face PRO
      • Enterprise Support
      • Inference Providers
      • Inference Endpoints
      • Storage Buckets

  • Log In
  • Sign Up

Datasets:
LocalLLaMA
/
typed-decisions

Benchmark
Tasks:
Text Classification
Modalities:
Tabular
Text
Formats:
parquet
Languages:
English
Size:
1K - 10K
Tags:
structured-decisions
calibration
probabilistic-classification
system-one
workflow-evaluation
Synthetic
Libraries:
Datasets
pandas
Polars
License:
Dataset card Data Studio Files Files and versions
xet
Community
9
typed-decisions
2.17 MB
Ctrl+K
Ctrl+K
  • 2 contributors
History: 26 commits
codelion's picture
codelion
Add Bekko System One v0 (17M, 68M, 400M) to the fine-tuned table, scored by us
d0e2f0c verified 1 day ago
  • agent_trace_observability
    full dataset: 400-case benchmark (test) + 1200-case training split, verified disjoint 15 days ago
  • all
    full dataset: 400-case benchmark (test) + 1200-case training split, verified disjoint 15 days ago
  • assets
    Leaderboard: zero-shot models only; add self-reported entries; second table for models fitted on train 1 day ago
  • customer_service
    full dataset: 400-case benchmark (test) + 1200-case training split, verified disjoint 15 days ago
  • invoice_processing
    full dataset: 400-case benchmark (test) + 1200-case training split, verified disjoint 15 days ago
  • security_incidents
    full dataset: 400-case benchmark (test) + 1200-case training split, verified disjoint 15 days ago
  • .gitattributes
    2.5 kB
    initial commit 16 days ago
  • README.md
    15.3 kB
    Add Bekko System One v0 (17M, 68M, 400M) to the fine-tuned table, scored by us 1 day ago
  • eval.yaml
    532 Bytes
    Add eval.yaml to register as a Hub benchmark (#9) 1 day ago