{
  "total": 25,
  "built": "2026-09-18",
  "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
  "findings": [
    {
      "id": "deals-undisclosed",
      "topic": "licensing deals",
      "statement": "65 of 75 publicly announced AI content licensing deals tracked have no publicly reported price (87%).",
      "numerator": 65,
      "denominator": 75,
      "percent": 87,
      "method": "A deal counts as priced only if a value was reported as the licence fee paid to the licensor. Equity, investments, damages sought and asking rates are excluded from the fee column.",
      "record_ids": [
        "licensing_deal:adobe-stock-contributors-adobe",
        "licensing_deal:agence-france-presse-mistral-ai",
        "licensing_deal:associated-press-google",
        "licensing_deal:associated-press-microsoft",
        "licensing_deal:associated-press-openai",
        "licensing_deal:atlantic-openai",
        "licensing_deal:automattic-openai-and-midjourney",
        "licensing_deal:axel-springer-openai",
        "licensing_deal:axios-openai",
        "licensing_deal:believe-suno",
        "licensing_deal:bmg-suno",
        "licensing_deal:conde-nast-and-hearst-amazon",
        "licensing_deal:conde-nast-openai",
        "licensing_deal:envato-bria-ai",
        "licensing_deal:financial-times-openai",
        "licensing_deal:future-openai",
        "licensing_deal:getty-images-bria-ai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:getty-images-perplexity-ai",
        "licensing_deal:getty-images-picsart",
        "licensing_deal:google-publisher-pilot-google",
        "licensing_deal:guardian-openai",
        "licensing_deal:hearst-openai",
        "licensing_deal:independent-filmmakers-and-footage-agencies-moonvalley",
        "licensing_deal:iop-publishing-cashmere",
        "licensing_deal:kobalt-music-elevenlabs",
        "licensing_deal:kobalt-music-spotify",
        "licensing_deal:kobalt-music-udio",
        "licensing_deal:le-monde-openai",
        "licensing_deal:lionsgate-runway",
        "licensing_deal:merlin-elevenlabs",
        "licensing_deal:merlin-spotify",
        "licensing_deal:merlin-udio",
        "licensing_deal:meta-publisher-meta",
        "licensing_deal:microsoft-copilot-daily-publisher-microsoft",
        "licensing_deal:national-music-publishers-association-member-publishers-klay-vision",
        "licensing_deal:national-music-publishers-association-member-publishers-udio",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:newsmax-meta",
        "licensing_deal:nine-entertainment-microsoft",
        "licensing_deal:oxford-university-press-undisclosed",
        "licensing_deal:photobucket-undisclosed-ai-companies",
        "licensing_deal:princeton-university-press-cashmere",
        "licensing_deal:prisa-openai",
        "licensing_deal:reddit-openai",
        "licensing_deal:reuters-meta",
        "licensing_deal:sage-causaly",
        "licensing_deal:schibsted-openai",
        "licensing_deal:shutterstock-lg-ai-research",
        "licensing_deal:shutterstock-nvidia",
        "licensing_deal:shutterstock-openai",
        "licensing_deal:shutterstock-reka-ai",
        "licensing_deal:stack-overflow-google",
        "licensing_deal:stack-overflow-openai",
        "licensing_deal:taylor-francis-microsoft",
        "licensing_deal:time-openai",
        "licensing_deal:universal-music-elevenlabs",
        "licensing_deal:universal-music-spotify",
        "licensing_deal:universal-music-udio",
        "licensing_deal:vox-openai",
        "licensing_deal:walt-disney-openai",
        "licensing_deal:warner-music-suno",
        "licensing_deal:warner-music-udio",
        "licensing_deal:washington-post-openai",
        "licensing_deal:youtube-creators-and-rights-holders-18-named-third-party-ai-companies"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#deals-undisclosed"
    },
    {
      "id": "deals-exclude-training",
      "topic": "licensing deals",
      "statement": "8 of 75 tracked AI content deals explicitly do NOT license the content for model training.",
      "numerator": 8,
      "denominator": 75,
      "percent": 11,
      "method": "Counts deals where the agreement is documented as display, attribution or output use with training excluded.",
      "record_ids": [
        "licensing_deal:getty-images-openai",
        "licensing_deal:getty-images-perplexity-ai",
        "licensing_deal:iop-publishing-cashmere",
        "licensing_deal:nine-entertainment-microsoft",
        "licensing_deal:princeton-university-press-cashmere",
        "licensing_deal:sage-causaly",
        "licensing_deal:walt-disney-openai",
        "licensing_deal:washington-post-openai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#deals-exclude-training"
    },
    {
      "id": "deals-top-content-type",
      "topic": "licensing deals",
      "statement": "News is the most-licensed content type among tracked AI licensing deals: 28 of 75.",
      "numerator": 28,
      "denominator": 75,
      "percent": 37,
      "method": "Deals grouped by the content type licensed.",
      "record_ids": [
        "licensing_deal:agence-france-presse-mistral-ai",
        "licensing_deal:associated-press-google",
        "licensing_deal:associated-press-microsoft",
        "licensing_deal:associated-press-openai",
        "licensing_deal:atlantic-openai",
        "licensing_deal:axel-springer-openai",
        "licensing_deal:axios-openai",
        "licensing_deal:conde-nast-and-hearst-amazon",
        "licensing_deal:conde-nast-openai",
        "licensing_deal:financial-times-openai",
        "licensing_deal:future-openai",
        "licensing_deal:google-publisher-pilot-google",
        "licensing_deal:guardian-openai",
        "licensing_deal:hearst-openai",
        "licensing_deal:le-monde-openai",
        "licensing_deal:meta-publisher-meta",
        "licensing_deal:microsoft-copilot-daily-publisher-microsoft",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:news-meta",
        "licensing_deal:news-openai",
        "licensing_deal:newsmax-meta",
        "licensing_deal:nine-entertainment-microsoft",
        "licensing_deal:prisa-openai",
        "licensing_deal:reuters-meta",
        "licensing_deal:schibsted-openai",
        "licensing_deal:time-openai",
        "licensing_deal:vox-openai",
        "licensing_deal:washington-post-openai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#deals-top-content-type",
      "breakdown": {
        "news": 28,
        "music": 15,
        "images": 11,
        "mixed": 6,
        "video": 4,
        "academic": 4,
        "books": 3,
        "forum": 2,
        "code": 2
      }
    },
    {
      "id": "deals-value-provenance",
      "topic": "licensing deals",
      "statement": "Of 17 AI licensing deal values checked against primary sources, 1 is confirmed by a party's own filing. The other 16 rest on press reporting that no party has confirmed.",
      "numerator": 1,
      "denominator": 17,
      "percent": 6,
      "method": "A value counts as confirmed only when a party states it in its own filing or release. Checks used SEC EDGAR filings, company annual reports and party newsrooms. Deals whose value was never reported at all are not in this count.",
      "record_ids": [
        "licensing_deal:adobe-stock-contributors-adobe",
        "licensing_deal:associated-press-google",
        "licensing_deal:associated-press-microsoft",
        "licensing_deal:conde-nast-and-hearst-amazon",
        "licensing_deal:dotdash-meredith-openai",
        "licensing_deal:envato-bria-ai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:harpercollins-microsoft",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:news-meta",
        "licensing_deal:news-openai",
        "licensing_deal:reddit-google",
        "licensing_deal:reddit-openai",
        "licensing_deal:reuters-meta",
        "licensing_deal:shutterstock-apple",
        "licensing_deal:taylor-francis-microsoft",
        "licensing_deal:wiley-undisclosed"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#deals-value-provenance"
    },
    {
      "id": "optouts-enforceable",
      "topic": "opt-out mechanisms",
      "statement": "Only 5 of 41 AI training opt-out mechanisms tracked are enforceable by law; 28 are voluntary commitments by the operator.",
      "numerator": 5,
      "denominator": 41,
      "percent": 12,
      "method": "Classified by legal force: enforceable law, contractual, voluntary, or proposed. A crawler honouring a robots.txt token is voluntary.",
      "record_ids": [
        "opt_out:california-drop-delete-act-sb-362",
        "opt_out:eu-ai-act-article-53-1-c-d-gpai-copyright-policy-and-training-summary",
        "opt_out:eu-tdm-rights-reservation-dsm-directive-article-4-3",
        "opt_out:gdpr-article-21-right-to-object-general",
        "opt_out:meta-ai-training-objection-gdpr-article-21-route"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#optouts-enforceable",
      "enforceable_jurisdictions": [
        "EU",
        "US-CA"
      ]
    },
    {
      "id": "datasets-commercial",
      "topic": "training datasets",
      "statement": "20 of 49 AI training datasets tracked are cleared for commercial use; for 14 the licence does not establish it either way.",
      "numerator": 20,
      "denominator": 49,
      "percent": 41,
      "method": "commercial_use is derived from the licence text or verified at the primary source. Unknown means not established, never assumed.",
      "record_ids": [
        "dataset:biodcase-2026-task-4-atbfl",
        "dataset:bridgedata-v2",
        "dataset:c4",
        "dataset:california-data-broker-registry-2026-first-party-count-talika-broker-to-model-count",
        "dataset:dexcap",
        "dataset:droid",
        "dataset:ego-exo4d",
        "dataset:ego4d",
        "dataset:egoverse",
        "dataset:english-french-translation-pairs",
        "dataset:europarl-parallel-corpus",
        "dataset:farstail",
        "dataset:gapa-gender-associations-of-physical-attributes",
        "dataset:mobile-aloha",
        "dataset:multilingual-un-parallel-corpus",
        "dataset:open-aoe-openaoe-2000h",
        "dataset:open-x-embodiment",
        "dataset:robocasa",
        "dataset:robonet",
        "dataset:umi"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#datasets-commercial"
    },
    {
      "id": "litigation-settled-with-figure",
      "topic": "litigation",
      "statement": "1 of 61 AI training data lawsuits tracked has a disclosed settlement figure.",
      "numerator": 1,
      "denominator": 61,
      "percent": 2,
      "method": "Settlement value is kept separate from damages sought and damages awarded. A figure pleaded in a complaint is not counted.",
      "record_ids": [
        "litigation:bartz-v-anthropic"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#litigation-settled-with-figure",
      "stages": {
        "filed": 21,
        "motion to dismiss": 15,
        "discovery": 8,
        "on appeal": 5,
        "summary judgment": 4,
        "settled": 2,
        "judgment": 2,
        "stayed": 2,
        "remanded": 1,
        "dismissed": 1
      }
    },
    {
      "id": "vendors-price-opacity",
      "topic": "data vendors",
      "statement": "Only 1 of 49 AI training data vendors tracked publishes what they charge buyers (Prolific); 4 publish a figure for what they pay contributors.",
      "numerator": 1,
      "denominator": 49,
      "percent": 2,
      "method": "Buyer pricing counts as published only as a figure or a stated fee percentage on the vendor's own page. Quote-only, tiers without prices and prices charged to rights holders rather than AI buyers do not count. A row that only points to another vendor's figure is not counted twice.",
      "record_ids": [
        "vendor:prolific"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#vendors-price-opacity"
    },
    {
      "id": "rates-two-markets",
      "topic": "human data work pay",
      "statement": "Published hourly pay for AI training data work splits into two markets: crowd and annotation work at $3 to $20 per hour, and robot demonstration and teleoperation at $25 to $55 per hour.",
      "numerator": 8,
      "denominator": 21,
      "percent": 38,
      "method": "Uses only rates published per hour in USD as a figure or range. Ranges report the full published bounds, not midpoints. Caps, floors, per-task rates and other currencies are excluded rather than converted.",
      "record_ids": [
        "rate:data-collection-crowd-claru",
        "rate:data-collection-crowd-opentrain-capture",
        "rate:data-labeling-appen-crowdgen",
        "rate:image-annotation-amazon-mechanical-turk",
        "rate:robot-demonstration-figure-ai",
        "rate:robot-demonstration-foundation",
        "rate:robot-demonstration-tesla-optimus",
        "rate:teleoperation-opentrain-ai-teleop"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#rates-two-markets",
      "markets": {
        "crowd and annotation": {
          "n": 4,
          "min_usd_per_hour": 2.83,
          "max_usd_per_hour": 20
        },
        "robot demonstration and teleoperation": {
          "n": 4,
          "min_usd_per_hour": 25,
          "max_usd_per_hour": 55
        }
      }
    },
    {
      "id": "orgs-top-licensee",
      "topic": "licensing deals",
      "statement": "OpenAI is the licensee in 22 of 75 tracked AI content licensing deals, more than any other company in the tracked set.",
      "numerator": 22,
      "denominator": 75,
      "percent": 29,
      "method": "Counts deals where the organisation is the party receiving the licence. Organisation names are reconciled across spellings and legal suffixes.",
      "record_ids": [
        "licensing_deal:associated-press-openai",
        "licensing_deal:atlantic-openai",
        "licensing_deal:axel-springer-openai",
        "licensing_deal:axios-openai",
        "licensing_deal:conde-nast-openai",
        "licensing_deal:dotdash-meredith-openai",
        "licensing_deal:financial-times-openai",
        "licensing_deal:future-openai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:guardian-openai",
        "licensing_deal:hearst-openai",
        "licensing_deal:le-monde-openai",
        "licensing_deal:news-openai",
        "licensing_deal:prisa-openai",
        "licensing_deal:reddit-openai",
        "licensing_deal:schibsted-openai",
        "licensing_deal:shutterstock-openai",
        "licensing_deal:stack-overflow-openai",
        "licensing_deal:time-openai",
        "licensing_deal:vox-openai",
        "licensing_deal:walt-disney-openai",
        "licensing_deal:washington-post-openai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#orgs-top-licensee"
    },
    {
      "id": "orgs-top-defendant",
      "topic": "litigation",
      "statement": "OpenAI is a defendant in 13 of 61 tracked AI training data lawsuits, more than any other company in the tracked set. Public trackers list roughly 200 such cases, so this ranks the tracked subset, not the whole docket.",
      "numerator": 13,
      "denominator": 61,
      "percent": 21,
      "method": "Counts cases naming the organisation as a defendant. Consolidated cases are counted as the registry records them.",
      "record_ids": [
        "litigation:ani-v-openai",
        "litigation:authors-guild-v-openai",
        "litigation:doe-1-v-github",
        "litigation:editorial-perfil-v-openai-and-microsoft",
        "litigation:gema-v-openai",
        "litigation:new-york-times-v-microsoft-and-openai",
        "litigation:raw-story-v-openai",
        "litigation:richner-communications-v-microsoft-and-openai",
        "litigation:seattle-times-and-newsday-v-microsoft-and-openai",
        "litigation:silverman-v-openai",
        "litigation:sullivan-v-openai",
        "litigation:the-intercept-v-openai",
        "litigation:wikihow-v-openai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#orgs-top-defendant"
    },
    {
      "id": "models-licensors-unnamed",
      "topic": "model disclosures",
      "statement": "54 of 56 tracked EU training-data summaries that answer yes or other on licensed data name no licensor. 10 of those developers hold 48 announced licensing deals in this registry.",
      "numerator": 54,
      "denominator": 56,
      "percent": 96,
      "method": "From the public summaries of training content that general-purpose AI model providers publish under EU AI Act Article 53(1)(d). 'Other' is counted with yes because those summaries describe partnerships in prose. Deals are joined to the developer organisation, not to a model: an announcement does not say which model the data trained.",
      "record_ids": [
        "model:adobe-firefly-image-model-5",
        "model:amazon-nova-2-lite",
        "model:bria-3-2",
        "model:chatgpt-images-2-0-gpt-image-2",
        "model:claude-fable-5-1-and-claude-mythos-5-1",
        "model:claude-mythos-5-and-claude-fable-5",
        "model:claude-mythos-preview",
        "model:claude-opus-4-7",
        "model:claude-opus-4-8",
        "model:claude-opus-5",
        "model:claude-sonnet-5",
        "model:command-a-c4ai-command-a-plus",
        "model:deepseek-v4-pro-and-flash",
        "model:elevenlabs-model-families-tts-voice-stt-music-non-speech",
        "model:fibo-fibo-fibo-lite-fibo-edit",
        "model:flux-3",
        "model:gemini-3-pro-family",
        "model:gemma-4-family",
        "model:gpt-5-2",
        "model:gpt-5-4-nano",
        "model:gpt-5-5",
        "model:gpt-5-6-luna",
        "model:gpt-6-astra",
        "model:grok-4-5",
        "model:hy3",
        "model:inkling",
        "model:inkling-small",
        "model:mai-code-1-1-flash",
        "model:mai-code-1-flash",
        "model:mai-cyber-1-flash",
        "model:mai-image-2",
        "model:mai-image-2-5",
        "model:mai-image-2-6-and-2-6-flash",
        "model:mai-thinking-1",
        "model:midjourney-image-and-video-family-v8-v8-1-v8-2",
        "model:minimax-h3",
        "model:minimax-m3",
        "model:ministral-3-14b-base-instruct-reasoning",
        "model:ministral-3-3b-base-instruct-reasoning",
        "model:ministral-3-8b-base-instruct-reasoning",
        "model:mistral-large-3",
        "model:mistral-small-4",
        "model:muse-glimmer",
        "model:muse-image",
        "model:muse-spark",
        "model:nvidia-nemotron-3-and-3-5-family",
        "model:phi-4",
        "model:phi-4-reasoning",
        "model:pllum-2512-base-4b-8b-12b",
        "model:pllum-2512-instruct-4b-8b-12b-70b",
        "model:seed-2-0-pro-dola-seed-2-0-pro",
        "model:seedance-2-0",
        "model:seedance-2-5",
        "model:seedream-5-0-pro-family-incl-seedream-5-0-lite"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#models-licensors-unnamed",
      "developers_with_deals": [
        "Adobe",
        "Amazon",
        "Bria AI",
        "ElevenLabs",
        "Google",
        "Meta",
        "Microsoft",
        "Mistral AI",
        "NVIDIA",
        "OpenAI"
      ]
    },
    {
      "id": "benchmarks-contamination-independent",
      "topic": "benchmarks",
      "statement": "12 of 38 tracked AI benchmarks have at least one contamination claim made by a party that is neither the benchmark's maintainer nor the model's developer. 10 of 38 have data established as usable commercially.",
      "numerator": 12,
      "denominator": 38,
      "percent": 32,
      "method": "A claim counts as independent only when the claimant is neither the benchmark maintainer nor the developer of the model named. A model developer's own disclosure of contamination is recorded but not counted. Commercial use is left unestablished when a licence covers only the compilation of material taken from elsewhere.",
      "record_ids": [
        "benchmark:aime-2025",
        "benchmark:gsm8k",
        "benchmark:hellaswag",
        "benchmark:humaneval",
        "benchmark:livecodebench",
        "benchmark:math",
        "benchmark:mbpp-mostly-basic-python-problems",
        "benchmark:mmlu",
        "benchmark:swe-bench",
        "benchmark:swe-bench-verified",
        "benchmark:truthfulqa",
        "benchmark:winogrande"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#benchmarks-contamination-independent"
    },
    {
      "id": "listings-price-disclosure",
      "topic": "training data prices",
      "statement": "37 of 79 AI training-data listings opened on data marketplaces showed a public price, and 18 tied that price to a volume of data. 0 of 25 listings on Defined.ai and Wirestock showed a price.",
      "numerator": 37,
      "denominator": 79,
      "percent": 47,
      "method": "Every listing card or dataset page actually opened on one day was counted. Priced means a currency amount visible without a login or a quote request. Category pages are sorted by the marketplace, so this is not a random sample.",
      "record_ids": [
        "listing:1-5-million-english-stem-test-questions-data-sample",
        "listing:1-51-million-sets-image-editing-data",
        "listing:10-000-hour-egocentric-video-dataset-opendatabay",
        "listing:100-000-stem-and-non-stem-e-books-multiple-languages-opendatabay",
        "listing:1000-segments-6-camera-egocentric-video-dataset-opendatabay",
        "listing:116-048-sets-3d-hand-pose-gesture-recognition-dataset-opendatabay",
        "listing:18-000-epub-e-books-stem-and-non-stem-opendatabay",
        "listing:2-5-million-hand-drawn-illustrations",
        "listing:220k-commercial-and-residential-egocentric-dataset",
        "listing:220k-hours-narrated-egocentric-video-dataset",
        "listing:28-500-multilingual-e-books-korean-european-and-indian-languages-opendatabay",
        "listing:288-million-3d-models-and-scenes-data-opendatabay",
        "listing:348000-simple-looped-mp4-animations",
        "listing:50-000-non-stem-multilingual-e-books-pdf-opendatabay",
        "listing:50-000-stem-e-books-pdf-opendatabay",
        "listing:50-hour-industrial-egocentric-stereo-electric-motor-rewinding-opendatabay",
        "listing:50k-hours-real-world-meeting-audio-dataset",
        "listing:892k-powerpoint-presentation-dataset",
        "listing:8khz-conversational-speech-data-15-000-hours-audio-data-speech-recognition-data-conversation-audio-data",
        "listing:a-speechdb-elra-s0315",
        "listing:accented-english-globalphone-elra-s0389",
        "listing:acoustic-database-for-polish-concatenative-speech-synthesis-elra-s0342",
        "listing:acoustic-database-for-polish-unit-selection-speech-synthesis-elra-s0339",
        "listing:aerial-video-of-nigeria-cities-opendatabay",
        "listing:aerialdataset-computer-vision-data-multi-view-drone-imagery-3d-scenes-multi-country",
        "listing:agender-elra-s0365",
        "listing:ai-training-dataset-audio-calls-and-transcriptions-real-support-conversations-for-training-conversational-and-sentiment-aware-ai",
        "listing:albayzin-corpus-elra-s0089",
        "listing:allies-corpus-french-broadcast-900-hours-elra-s0486",
        "listing:american-canadian-english-speech-recognition-corpus-desktop-elra-s0228-102",
        "listing:american-children-speech-data-by-microphone-50-hours-elra-s0468",
        "listing:american-english-conversational-speech-recognition-corpus-elra-s0228-93",
        "listing:american-english-speech-data-by-mobile-phone-800-hours-elra-s0437",
        "listing:american-english-speech-data-by-mobile-phone-reading-215-hours-elra-s0467",
        "listing:american-english-speech-recognition-corpus-mobile-elra-s0228-113",
        "listing:american-english-wake-up-words-speech-recognition-corpus-elra-s0228-58",
        "listing:american-spanish-speech-recognition-corpus-desktop-elra-s0228-68",
        "listing:anita-audio-enhancement-in-telecom-applications-elra-s0156",
        "listing:annotated-tweet-corpus-in-arabizi-french-and-english-elra-w0323",
        "listing:apasci-elra-s0039",
        "listing:arab-full-names-database-elra-l0209",
        "listing:arabic-speech-corpus-halabi-elra-s0384",
        "listing:arablex-database-of-arabic-general-vocabulary-dag-elra-l0131",
        "listing:arablex-database-of-foreign-names-in-arabic-daf-elra-m0106",
        "listing:arbobanko-esperanto-treebank-elra-w0129",
        "listing:archives-of-el-mundo-newspaper-years-2020-2022-elra-w0332",
        "listing:argentina-spanish-speech-recognition-corpus-desktop-elra-s0228-124",
        "listing:argentina-spanish-speech-recognition-corpus-mobile-elra-s0228-129",
        "listing:asia-egocentric-dataset-with-imu-data-opendatabay",
        "listing:asia-residential-teleoperation-video-dataset-opendatabay",
        "listing:asia-stereo-egocentric-vision-dataset-with-calibration-opendatabay",
        "listing:asia-tactile-glove-hand-pose-and-contact-dataset-opendatabay",
        "listing:atco2-project-data-elra-s0484",
        "listing:audio-data-speech-datasets-real-call-center-conversations-for-asr-voice-ai",
        "listing:augmentation-pricing-table-flip-colour-and-zoom-add-on",
        "listing:australian-english-kids-speech-recognition-corpus-desktop-elra-s0228-97",
        "listing:australian-english-speech-data-by-mobile-phone-199-hours-elra-s0424",
        "listing:australian-english-speech-recognition-corpus-desktop-elra-s0228-119",
        "listing:bdbruit-elra-s0033",
        "listing:bengali-bangladesh-real-life-conversational-data-opendatabay",
        "listing:bitext-lexical-dataset-language-variants-english-elra-l0154",
        "listing:bref-120-a-large-corpus-of-french-read-speech-elra-s0067",
        "listing:bref-80-elra-s0006",
        "listing:british-english-speech-recognition-corpus-mobile-elra-s0228-111",
        "listing:c-oral-rom-integrated-reference-corpora-for-spoken-romance-languages-elra-s0172",
        "listing:canadian-french-speech-recognition-corpus-mobile-elra-s0228-72",
        "listing:chatbot-conversation-dataset-english-hindi-real-customer-service-audio-datarade",
        "listing:commercial-source-code-engineering-data-opendatabay",
        "listing:custom-on-site-speech-audio-data-collection-datarade",
        "listing:custom-pair-conversational-speech-audio-video-data-collection-in-80-languages-datarade",
        "listing:customer-service-voice-data-stream-high-emotion-audio-dataset-us-accents-datarade",
        "listing:drone-park-vehicle-congestion-dataset",
        "listing:egocentric-first-person-audio-dataset-opendatabay",
        "listing:egocentric-video-dataset-pico-motion-trackers-setup-2-321-hours-datarade",
        "listing:egocentric-video-dataset-zed-pico-motion-trackers-setup-1-729-hours-datarade",
        "listing:enterprise-operational-workflow-data-opendatabay",
        "listing:high-impact-synthetic-reasoning-dataset-3-gpqa-diamond-lift-opendatabay",
        "listing:hindi-ai-training-dataset-support-calls-real-customer-voice-data-datarade",
        "listing:hindi-conversational-speech-dataset-real-support-dialogues-datarade",
        "listing:industrial-bearing-thermography-dataset-opendatabay",
        "listing:italian-speech-corpus-1-appen-elra-s0147",
        "listing:kids-teens-aging-dataset-ages-7-15-10-214-images-for-face-recognition-and-biometric-verification",
        "listing:long-term-malware-detonation-pcaps-feed-annual-license-opendatabay",
        "listing:mahatma-gandhi-multimodal-historical-archive-opendatabay",
        "listing:medical-masks-dataset-167-880-images-for-face-mask-detection-datarade",
        "listing:meeting-recordings",
        "listing:mini-set-premium-studio-grade-multi-speaker-english-conversational-audio-dataset-w-stems-transcripts-1k-hours-2-speakers-new-hours-month",
        "listing:multilingual-books-corpus-10-indian-languages",
        "listing:multilingual-speech-audio-dataset-indian-and-international-languages-opendatabay",
        "listing:multilingual-speech-recordings-13-languages-native-speakers-licensed-for-ai-ml-datarade",
        "listing:nemlar-broadcast-news-speech-corpus-elra-s0219",
        "listing:norwegian-91-73h-asr-llm-stt-tts-training-dataset-human-transcribed-datarade",
        "listing:novelty-ai-creative-generation-corpus-images-and-videos-generated-for-paid-ads-opendatabay",
        "listing:open-palm-hand-images-dataset-500-000-images-for-hand-detection-and-gesture-recognition",
        "listing:real-world-casual-conversation-and-monologue-speech-data-20-000-hours-spontaneous-speech-audio-data-text-to-speech-data",
        "listing:south-asia-residential-mono-egocentric-video-dataset-opendatabay",
        "listing:standard-pricing-table-build-your-own-dataset-from-500-000-released-images",
        "listing:synthetic-media-pricing-table-extended-license-for-generative-visual-models",
        "listing:ta-da-data-collection-platform-for-ai",
        "listing:tag-modification-pricing-table-custom-tags-delivered-as-a-text-file"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#listings-price-disclosure",
      "per_marketplace": [
        {
          "marketplace": "Datarade",
          "inspected": 27,
          "priced": 14,
          "with_unit_basis": 2
        },
        {
          "marketplace": "Opendatabay",
          "inspected": 12,
          "priced": 12,
          "with_unit_basis": 8
        },
        {
          "marketplace": "ELRA Catalogue",
          "inspected": 8,
          "priced": 8,
          "with_unit_basis": 6
        },
        {
          "marketplace": "DataSet Shop",
          "inspected": 1,
          "priced": 1,
          "with_unit_basis": 1
        },
        {
          "marketplace": "AWS Marketplace",
          "inspected": 5,
          "priced": 2,
          "with_unit_basis": 1
        },
        {
          "marketplace": "Defined.ai",
          "inspected": 16,
          "priced": 0,
          "with_unit_basis": 0
        },
        {
          "marketplace": "Wirestock",
          "inspected": 9,
          "priced": 0,
          "with_unit_basis": 0
        },
        {
          "marketplace": "LDC (Linguistic Data Consortium)",
          "inspected": 1,
          "priced": 0,
          "with_unit_basis": 0
        }
      ]
    },
    {
      "id": "enforcement-priced",
      "topic": "what regulators charge",
      "statement": "18 of 33 regulator actions over AI training data carry a money figure. The rest are orders, bans, reprimands and undertakings, where the regulator either has no fining power or did not use it.",
      "numerator": 18,
      "denominator": 33,
      "percent": 55,
      "method": "Only actions whose subject is AI training data, model training on personal or copyrighted material, scraping for AI, or biometric data used for AI. A GDPR fine for a breach is out of scope. Amounts are as the regulator published them and are never converted between currencies, so the figures below are grouped by currency rather than summed. An amount that an appeal has erased is not counted as a price.",
      "record_ids": [
        "enforcement:aepd-v-mercadona-2021",
        "enforcement:aepd-v-tools-for-humanity-worldcoin-2024",
        "enforcement:anpd-v-meta-2024",
        "enforcement:autoriteit-persoonsgegevens-v-clearview-ai-2024",
        "enforcement:baylda-v-tools-for-humanity-world-2024",
        "enforcement:cnil-v-clearview-ai-2022",
        "enforcement:cnil-v-clearview-ai-penalty-payment-liquidation-2023",
        "enforcement:dpc-ireland-v-x-grok-2024",
        "enforcement:ftc-and-doj-v-amazon-alexa-2023",
        "enforcement:ftc-and-doj-v-ww-international-and-kurbo-2022",
        "enforcement:ftc-in-re-everalbum-paravision-2021",
        "enforcement:ftc-v-ring-2023",
        "enforcement:ftc-v-rite-aid-2023",
        "enforcement:garante-v-clearview-ai-2022",
        "enforcement:garante-v-clothoff-2025",
        "enforcement:garante-v-deepseek-2025",
        "enforcement:garante-v-luka-inc-replika-2025",
        "enforcement:garante-v-openai-2024",
        "enforcement:hellenic-dpa-v-clearview-ai-2022",
        "enforcement:ico-v-clearview-ai-2022",
        "enforcement:ico-v-serco-leisure-2024",
        "enforcement:imy-v-swedish-police-authority-over-clearview-ai-2021",
        "enforcement:naih-v-budapest-bank-2022",
        "enforcement:oaic-v-bunnings-2024",
        "enforcement:oaic-v-clearview-ai-2021",
        "enforcement:oaic-v-kmart-australia-2025",
        "enforcement:opc-canada-and-provincial-commissioners-v-clearview-ai-2021",
        "enforcement:pipc-v-deepseek-2025",
        "enforcement:pipc-v-scatterlab-iruda-2021",
        "enforcement:pipc-v-worldcoin-foundation-and-tools-for-humanity-2024",
        "enforcement:ppc-japan-administrative-guidance-to-openai-2023",
        "enforcement:texas-attorney-general-v-google-2025",
        "enforcement:texas-attorney-general-v-meta-2024"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#enforcement-priced",
      "erased_on_appeal": [
        {
          "name": "Garante v. OpenAI (2024)",
          "amount": 15000000,
          "currency": "EUR"
        },
        {
          "name": "ICO v. Clearview AI (2022)",
          "amount": 7552800,
          "currency": "GBP"
        }
      ],
      "by_currency": {
        "EUR": {
          "n": 8,
          "max": 30500000,
          "median": 17500000
        },
        "USD": {
          "n": 5,
          "max": 1400000000,
          "median": 25000000
        },
        "GBP": {
          "n": 1,
          "max": 7552800,
          "median": 7552800
        },
        "SEK": {
          "n": 1,
          "max": 2500000,
          "median": 2500000
        },
        "HUF": {
          "n": 1,
          "max": 250000000,
          "median": 250000000
        },
        "KRW": {
          "n": 2,
          "max": 1140000000,
          "median": 621650000
        }
      }
    },
    {
      "id": "models-crawler-named",
      "topic": "what developers disclose",
      "statement": "39 of 76 EU public training-data summaries name the crawler that collected the web data. 23 name only a third-party corpus such as Common Crawl, and 14 name neither. A crawler nobody names is a crawler nobody can block.",
      "numerator": 39,
      "denominator": 76,
      "percent": 51,
      "method": "Each summary was read for a user-agent string, never inferred from the developer: OpenAI publishing a summary is not the summary naming GPTBot. A corpus named in the crawler field (Common Crawl, RefinedWeb, FineWeb) is counted as corpus, not as a crawler. Summaries that tick 'crawlers used: yes' and then answer the name field with 'NA', a hyperlink or a confidentiality clause are counted as not naming one.",
      "record_ids": [
        "model:amazon-nova-2-lite",
        "model:bielik-v3-11b-instruct",
        "model:chatgpt-images-2-0-gpt-image-2",
        "model:claude-fable-5-1-and-claude-mythos-5-1",
        "model:claude-mythos-5-and-claude-fable-5",
        "model:claude-mythos-preview",
        "model:claude-opus-4-7",
        "model:claude-opus-4-8",
        "model:claude-opus-5",
        "model:claude-sonnet-5",
        "model:gemini-3-pro-family",
        "model:gemma-4-family",
        "model:gpt-5-2",
        "model:gpt-5-4-nano",
        "model:gpt-5-5",
        "model:gpt-5-6-luna",
        "model:gpt-6-astra",
        "model:grok-4-5",
        "model:grok-voice-think-fast-2-0",
        "model:hy3",
        "model:luciole-base-1b-8b-23b",
        "model:mai-code-1-1-flash",
        "model:mai-code-1-flash",
        "model:mai-cyber-1-flash",
        "model:mai-image-2",
        "model:mai-image-2-5",
        "model:mai-image-2-6-and-2-6-flash",
        "model:mai-thinking-1",
        "model:minimax-h3",
        "model:minimax-m3",
        "model:nvidia-nemotron-3-and-3-5-family",
        "model:nvidia-nemotron-nano-12b-v2-vl",
        "model:pleias-1-0-350m-1-2b-3b-preview",
        "model:pllum-2512-base-4b-8b-12b",
        "model:pllum-2512-instruct-4b-8b-12b-70b",
        "model:seed-2-0-pro-dola-seed-2-0-pro",
        "model:seedance-2-0",
        "model:seedance-2-5",
        "model:seedream-5-0-pro-family-incl-seedream-5-0-lite"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#models-crawler-named",
      "most_named": [
        {
          "crawler": "Bingbot",
          "summaries": 7
        },
        {
          "crawler": "ClaudeBot",
          "summaries": 7
        },
        {
          "crawler": "GPTBot",
          "summaries": 6
        },
        {
          "crawler": "Bytespider",
          "summaries": 4
        },
        {
          "crawler": "CCBot",
          "summaries": 3
        }
      ],
      "not_carried_as_crawler_rows": [
        "Bingbot",
        "EDGAR-Crawler",
        "MINIMAX_UA",
        "Sogou News Spider",
        "Sogou Web Spider",
        "Speakleash",
        "nvidiabot",
        "xAI Web Crawler"
      ]
    },
    {
      "id": "procurement-unit-price",
      "topic": "what buyers pay for data work",
      "statement": "0 of 40 public contract awards for AI data work state a price per unit of data. 38 state a total amount at all. An award notice is the one public filing that gives a buyer's price, and it gives a contract total, not a rate per image, hour or word.",
      "numerator": 0,
      "denominator": 40,
      "percent": 0,
      "method": "Awards were read from USAspending, UK Contracts Finder and EU TED, keeping only notices whose OBJECT is data collection, annotation or licensing for AI. Amounts are as filed, never converted between currencies, and obligated amounts are not mixed with ceilings in the medians. Two notices with image counts but no price were not divided out. The largest known contracts of this kind, such as the NGA SEQUOIA award, never reach these systems, so this is not the top of the market.",
      "record_ids": [
        "procurement:contractsfinder-07c68948-4503-411f-87f4-fde9dc38ae3a",
        "procurement:contractsfinder-09576c74-3227-448c-8635-6837cdada4e2",
        "procurement:contractsfinder-20ebfe7c-6a0b-4c14-b3e8-fe134854ca7b",
        "procurement:contractsfinder-81139f0d-dce3-47de-8df9-14fb8ea0dcb3",
        "procurement:contractsfinder-93a8f85a-952c-42e2-abaa-affb01a34c8e",
        "procurement:contractsfinder-97a9183f-e06f-46e2-9e42-1e87bfbd3258",
        "procurement:ted-13954-2025",
        "procurement:ted-418557-2026",
        "procurement:ted-834695-2025",
        "procurement:usaspending-cont-awd-0005-9700-w911qx10d0011-9700",
        "procurement:usaspending-cont-awd-1333mf24p0244-1330-none-none",
        "procurement:usaspending-cont-awd-140g0322p0091-1434-none-none",
        "procurement:usaspending-cont-awd-70b04c21p00000222-7014-none-none",
        "procurement:usaspending-cont-awd-70rsat20c00000014-7001-none-none",
        "procurement:usaspending-cont-awd-70rsat24c00000026-7001-none-none",
        "procurement:usaspending-cont-awd-70rsat24c00000033-7001-none-none",
        "procurement:usaspending-cont-awd-70rsat24c00000034-7001-none-none",
        "procurement:usaspending-cont-awd-70rsat25c00000003-7001-none-none",
        "procurement:usaspending-cont-awd-75n91020f00031-7529-75n91019d00024-7529",
        "procurement:usaspending-cont-awd-docsb134118cn0003-1341-none-none",
        "procurement:usaspending-cont-awd-fa702225f0052-9700-fa702217d0009-9700",
        "procurement:usaspending-cont-awd-fa860410m7934-9700-none-none",
        "procurement:usaspending-cont-awd-fa864922p0294-9700-none-none",
        "procurement:usaspending-cont-awd-fa864922p0989-9700-none-none",
        "procurement:usaspending-cont-awd-fa864922p1097-9700-none-none",
        "procurement:usaspending-cont-awd-fa864922p1158-9700-none-none",
        "procurement:usaspending-cont-awd-fa864923p0478-9700-none-none",
        "procurement:usaspending-cont-awd-fa864923p0795-9700-none-none",
        "procurement:usaspending-cont-awd-fa864923p1115-9700-none-none",
        "procurement:usaspending-cont-awd-fa864924p0164-9700-none-none",
        "procurement:usaspending-cont-awd-fa864924p0234-9700-none-none",
        "procurement:usaspending-cont-awd-fa873024pb018-9700-none-none",
        "procurement:usaspending-cont-awd-fa875019c0203-9700-none-none",
        "procurement:usaspending-cont-awd-hdtra122p0002-9700-none-none",
        "procurement:usaspending-cont-awd-hr001115c0116-9700-none-none",
        "procurement:usaspending-cont-awd-w5170122c0028-9700-none-none",
        "procurement:usaspending-cont-awd-w5170122c0029-9700-none-none",
        "procurement:usaspending-cont-awd-w5170125ca095-9700-none-none",
        "procurement:usaspending-cont-awd-w911qx11p0362-9700-none-none",
        "procurement:usaspending-cont-awd-w911qx17p0259-9700-none-none"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#procurement-unit-price",
      "median_annotation_award": {
        "USD": {
          "n": 18,
          "median": 749276
        },
        "GBP": {
          "n": 3,
          "median": 46500
        }
      }
    },
    {
      "id": "vendor-pay-advertised-vs-reported",
      "topic": "worker pay",
      "statement": "10 of 49 tracked data vendors now carry a worker-reported pay figure alongside what the vendor publishes, and 10 carry both. The two are listed side by side rather than compared, because they are quoted on different bases.",
      "numerator": 10,
      "denominator": null,
      "percent": null,
      "method": "Reported pay comes from news investigations with documents or named sample sizes, union statements, audited surveys (Fairwork, ILO) and salary sites that state how many submissions a figure rests on. It is carried verbatim, never parsed into a number, because the quotes mix hourly, annual and per-task bases. Vendor pay is what the vendor publishes. Neither figure is adjusted for region or year.",
      "record_ids": [
        "vendor:alignerr-labelbox",
        "vendor:appen",
        "vendor:dataannotation",
        "vendor:mercor",
        "vendor:outlier-scale-ai",
        "vendor:prolific",
        "vendor:remotasks-scale-ai",
        "vendor:sama",
        "vendor:surge-ai",
        "vendor:telus-digital"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#vendor-pay-advertised-vs-reported",
      "pairs": [
        {
          "vendor": "Alignerr (Labelbox)",
          "vendor_says": "vendor page: '$80/hr average pay', '$1M paid weekly'; listings show $30-50/hr, $40-120/hr and $30-35/hr depending on role",
          "reported": "community-reported range widens to $15-$60/hr with an average around $37/hr; voice work billed Per Finished Hour 'about $9 per real hour worked'",
          "sample": 81,
          "source": "reddit aggregator (single-author blog), 90 days ending 2026-08-16"
        },
        {
          "vendor": "Appen",
          "vendor_says": "not published on corporate pages read",
          "reported": "median US$1.50/hr paid work (mean 2.65, 298 observations); median US$1.11/hr paid and unpaid work (mean 1.95)",
          "sample": 298,
          "source": "academic/ILO survey, 2017 survey"
        },
        {
          "vendor": "DataAnnotation",
          "vendor_says": "about $20/hr for general work (also reported: $40 per coding task)",
          "reported": "'based on 127 salaries submitted' (AI Trainer, band $60,499-$111,669/yr); Remote AI Trainer '$112,134 per year or $54 per hour' (glassdoor.ca)",
          "sample": 127,
          "source": "glassdoor, to 2026-09"
        },
        {
          "vendor": "Mercor",
          "vendor_says": "vendor page: software engineers 'get paid $80 to $200/hr to help train frontier AI systems'. Mercor's 'AI trainer salary' article ($12 to $200+/hr) is a market estimate sourced from Glassdoor/ZipRecruiter/Indeed, NOT Mercor's own pay, and is excluded",
          "reported": "$16 an hour (Nova), down from $21/hr (Musen); some contractors previously earned as much as $60 an hour on other projects",
          "sample": 3,
          "source": "news investigation (email seen + workers), 2025-11"
        },
        {
          "vendor": "Outlier (Scale AI)",
          "vendor_says": "no rate card; site states only 'competitive pay + quality-based rewards, paid weekly' and an aggregate '$500M+ paid to experts'",
          "reported": "$60,499 (25th percentile) - $111,669 (75th percentile) annually, 'based on 118 salaries submitted'; Trainer title: '$37 per hour' (13 salaries submitted)",
          "sample": 118,
          "source": "glassdoor, to 2026-09 (118 salaries); 2025-04 snapshot for Trainer (13)"
        },
        {
          "vendor": "Prolific",
          "vendor_says": "minimum '£6.00 / $8.00 per hour'; recommended 'at least £9.00 / $12.00 per hour'; underpaying studies are blocked",
          "reported": "median US$4.55/hr paid work (mean 5.45, 450 observations); median US$3.56/hr paid and unpaid (mean 4.26, 446 observations)",
          "sample": 450,
          "source": "academic/ILO survey, 2017 survey"
        },
        {
          "vendor": "Remotasks (Scale AI)",
          "vendor_says": "no rate published; pay 'based on the quality and number of tasks', weekly via PayPal or AirTM; site claims '$15M total earnings' across '240,000+ taskers' (aggregate, not a rate)",
          "reported": "Fairwork Cloudwork score 2/10; no Fair Pay points (threshold 1.1 paid on time for all work, and 1.2 paid at least local minimum wage, not evidenced)",
          "sample": 70,
          "source": "fairwork, 2024-02 to 2025-01 (survey window)"
        },
        {
          "vendor": "Sama",
          "vendor_says": "no current wage rate published; living-wage commitment and impact stats ('average of 3.6x increase in their earnings when joining'); cites 2021 Nairobi minimum wage Ksh 13,572 (~$119) vs family living cost Ksh 39,622 (~$394)/month",
          "reported": "take-home wage of between around $1.32 and $2 per hour depending on seniority and performance",
          "sample": 4,
          "source": "news investigation (payslips + interviews), 2021-11 to 2022-02"
        },
        {
          "vendor": "Surge AI",
          "vendor_says": "no rate card; one published listing on its workforce page: 'Award-Winning Author / Journalist' at $200 to $400/hour (contractor)",
          "reported": "The workers I spoke with earned between $15 and $30 per hour",
          "sample": null,
          "source": "news investigation (interviews), 2023-06"
        },
        {
          "vendor": "TELUS Digital",
          "vendor_says": "not published",
          "reported": "'based on 17 salaries submitted by TELUS Digital AI rater professionals' (band $92,030-$155,689/yr); AI Search Rater 'estimated total pay ... $34 per hour ... estimated base pay is $27 per hour'",
          "sample": 17,
          "source": "glassdoor, to 2026-09"
        }
      ]
    },
    {
      "id": "listings-price-per-hour",
      "topic": "training data prices",
      "statement": "Published prices per hour of training data: audio in EUR: median 214 per hour across 30 listings, from 35 to 3,027; video in GBP: median 60 per hour across 9 listings, from 6 to 2,886; audio in USD: median 25 per hour across 9 listings, from 25 to 250.",
      "numerator": 48,
      "denominator": null,
      "percent": null,
      "method": "Only listings whose own page ties the price to a number of hours. Prices are the seller's list price in the seller's currency, not converted and not negotiated. Catalogues that publish prices (ELRA, Opendatabay) dominate the sample, so this is the price of openly listed data, not of quote-only premium collections.",
      "record_ids": [
        "listing:10-000-hour-egocentric-video-dataset-opendatabay",
        "listing:220k-commercial-and-residential-egocentric-dataset",
        "listing:220k-hours-narrated-egocentric-video-dataset",
        "listing:50-hour-industrial-egocentric-stereo-electric-motor-rewinding-opendatabay",
        "listing:a-speechdb-elra-s0315",
        "listing:accented-english-globalphone-elra-s0389",
        "listing:acoustic-database-for-polish-concatenative-speech-synthesis-elra-s0342",
        "listing:acoustic-database-for-polish-unit-selection-speech-synthesis-elra-s0339",
        "listing:agender-elra-s0365",
        "listing:allies-corpus-french-broadcast-900-hours-elra-s0486",
        "listing:american-canadian-english-speech-recognition-corpus-desktop-elra-s0228-102",
        "listing:american-children-speech-data-by-microphone-50-hours-elra-s0468",
        "listing:american-english-conversational-speech-recognition-corpus-elra-s0228-93",
        "listing:american-english-speech-data-by-mobile-phone-800-hours-elra-s0437",
        "listing:american-english-speech-data-by-mobile-phone-reading-215-hours-elra-s0467",
        "listing:american-english-speech-recognition-corpus-mobile-elra-s0228-113",
        "listing:american-english-wake-up-words-speech-recognition-corpus-elra-s0228-58",
        "listing:american-spanish-speech-recognition-corpus-desktop-elra-s0228-68",
        "listing:anita-audio-enhancement-in-telecom-applications-elra-s0156",
        "listing:apasci-elra-s0039",
        "listing:arabic-speech-corpus-halabi-elra-s0384",
        "listing:argentina-spanish-speech-recognition-corpus-desktop-elra-s0228-124",
        "listing:argentina-spanish-speech-recognition-corpus-mobile-elra-s0228-129",
        "listing:asia-egocentric-dataset-with-imu-data-opendatabay",
        "listing:asia-residential-teleoperation-video-dataset-opendatabay",
        "listing:asia-stereo-egocentric-vision-dataset-with-calibration-opendatabay",
        "listing:asia-tactile-glove-hand-pose-and-contact-dataset-opendatabay",
        "listing:audio-data-speech-datasets-real-call-center-conversations-for-asr-voice-ai",
        "listing:australian-english-kids-speech-recognition-corpus-desktop-elra-s0228-97",
        "listing:australian-english-speech-data-by-mobile-phone-199-hours-elra-s0424",
        "listing:australian-english-speech-recognition-corpus-desktop-elra-s0228-119",
        "listing:bdbruit-elra-s0033",
        "listing:bref-120-a-large-corpus-of-french-read-speech-elra-s0067",
        "listing:bref-80-elra-s0006",
        "listing:british-english-speech-recognition-corpus-mobile-elra-s0228-111",
        "listing:c-oral-rom-integrated-reference-corpora-for-spoken-romance-languages-elra-s0172",
        "listing:canadian-french-speech-recognition-corpus-mobile-elra-s0228-72",
        "listing:chatbot-conversation-dataset-english-hindi-real-customer-service-audio-datarade",
        "listing:custom-on-site-speech-audio-data-collection-datarade",
        "listing:custom-pair-conversational-speech-audio-video-data-collection-in-80-languages-datarade",
        "listing:customer-service-voice-data-stream-high-emotion-audio-dataset-us-accents-datarade",
        "listing:hindi-ai-training-dataset-support-calls-real-customer-voice-data-datarade",
        "listing:hindi-conversational-speech-dataset-real-support-dialogues-datarade",
        "listing:italian-speech-corpus-1-appen-elra-s0147",
        "listing:multilingual-speech-recordings-13-languages-native-speakers-licensed-for-ai-ml-datarade",
        "listing:nemlar-broadcast-news-speech-corpus-elra-s0219",
        "listing:south-asia-residential-mono-egocentric-video-dataset-opendatabay",
        "listing:ta-da-data-collection-platform-for-ai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#listings-price-per-hour",
      "groups": [
        {
          "modality": "audio",
          "currency": "EUR",
          "n": 30,
          "median": 214.43,
          "min": 34.72,
          "max": 3027.03
        },
        {
          "modality": "video",
          "currency": "GBP",
          "n": 9,
          "median": 60.12,
          "min": 6.09,
          "max": 2886
        },
        {
          "modality": "audio",
          "currency": "USD",
          "n": 9,
          "median": 25,
          "min": 25,
          "max": 250
        }
      ]
    },
    {
      "id": "benchmarks-canary-strings",
      "topic": "benchmarks",
      "statement": "7 of 36 AI benchmarks whose released files we scanned carry a canary string, the marker that makes contamination provable instead of arguable.",
      "numerator": 7,
      "denominator": 36,
      "percent": 19,
      "method": "Each row was scanned in its released data files (Hugging Face parquet and rows API, repository tarballs, published artifacts), and the file and method are recorded on the row. Benchmarks whose files were not scanned are excluded from both counts. Every canary found is the same BIG-bench GUID, reused by later benchmarks.",
      "record_ids": [
        "benchmark:big-bench",
        "benchmark:browsecomp",
        "benchmark:gpqa",
        "benchmark:gpqa-diamond",
        "benchmark:humanity-s-last-exam-hle",
        "benchmark:mteb-massive-text-embedding-benchmark",
        "benchmark:terminal-bench"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#benchmarks-canary-strings"
    },
    {
      "id": "datasets-license-chain-conflict",
      "topic": "dataset licensing",
      "statement": "8 of 27 datasets whose rights chain was read back to the material they are built from carry terms that conflict: a permissive licence at the top over sources that restrict commercial use, or a card that grants and withholds it in the same page.",
      "numerator": 8,
      "denominator": 27,
      "percent": 30,
      "method": "Each row was checked against the LICENSE file, the dataset card and the terms of the named upstream sources, not against a repository tag. Both sides of a conflict are recorded and no verdict is picked, so commercial use stays unestablished for these rows.",
      "record_ids": [
        "dataset:bench2dex",
        "dataset:biodcase-2026-task-4-birdset-subsets-hsn-pow-uhh",
        "dataset:dclm-baseline-1-0",
        "dataset:egoverse",
        "dataset:finefineweb",
        "dataset:llava-onevision-1-5-mid-training-85m",
        "dataset:openeai-dataset",
        "dataset:uniocc"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#datasets-license-chain-conflict",
      "examples": [
        {
          "dataset": "Bench2Dex",
          "conflict": ""
        },
        {
          "dataset": "BioDCASE 2026 Task 4: BirdSet subsets (HSN, POW, UHH)",
          "conflict": ""
        },
        {
          "dataset": "EgoVerse",
          "conflict": ""
        },
        {
          "dataset": "FineFineWeb",
          "conflict": ""
        },
        {
          "dataset": "LLaVA-OneVision-1.5-Mid-Training-85M",
          "conflict": ""
        },
        {
          "dataset": "OpenEAI-Dataset",
          "conflict": ""
        },
        {
          "dataset": "dclm-baseline-1.0",
          "conflict": ""
        },
        {
          "dataset": "uniocc",
          "conflict": ""
        }
      ]
    },
    {
      "id": "crawl-blocks-licensed-still-blocking",
      "topic": "AI crawlers",
      "statement": "13 of 65 sites that signed a licensing deal in this registry still disallow the crawler of a company they licensed to. A licence is a feed, not a crawl permit.",
      "numerator": 13,
      "denominator": 65,
      "percent": 20,
      "method": "Joins the measured robots.txt state to this registry's licensing deals by hostname and licensee. Counted only when the blocked operator is one the site actually signed with. Says nothing about what a contract permits privately: a deal can deliver data by feed or dump while the public crawler stays blocked. Not a first: FT Strategies published the same join on 2026-07-14 across 70 publishers and named AP, the FT, El Pais and USA Today. This names 13 sites, per crawler and per deal, and is a dated state that can be diffed against theirs.",
      "record_ids": [
        "crawl_block:apnews-com",
        "crawl_block:disney-com",
        "crawl_block:dotdashmeredith-com",
        "crawl_block:politico-com",
        "crawl_block:reddit-com",
        "crawl_block:reuters-com",
        "crawl_block:shutterstock-com",
        "crawl_block:stackexchange-com",
        "crawl_block:stackoverflow-com",
        "crawl_block:thetimes-co-uk",
        "crawl_block:theverge-com",
        "crawl_block:vox-com",
        "crawl_block:wsj-com"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#crawl-blocks-licensed-still-blocking",
      "examples": [
        "apnews.com",
        "disney.com",
        "dotdashmeredith.com",
        "politico.com",
        "reddit.com",
        "reuters.com",
        "shutterstock.com",
        "stackexchange.com",
        "stackoverflow.com",
        "thetimes.co.uk",
        "theverge.com",
        "vox.com",
        "wsj.com"
      ]
    },
    {
      "id": "orgs-license-and-sued",
      "topic": "licensing and litigation",
      "statement": "12 companies in the tracked set both license content for AI and are defendants in individual AI training data lawsuits: Adobe, Amazon, Apple, ElevenLabs, Google, Meta, Microsoft, NVIDIA, OpenAI, Perplexity AI, Suno, Udio.",
      "numerator": 12,
      "denominator": null,
      "percent": null,
      "method": "A company counts when it is the licensee in at least one tracked content deal AND a named defendant in at least one individually recorded case. A bundled record covering several suits from one source is excluded.",
      "record_ids": [
        "licensing_deal:adobe-stock-contributors-adobe",
        "licensing_deal:associated-press-google",
        "licensing_deal:associated-press-microsoft",
        "licensing_deal:associated-press-openai",
        "licensing_deal:atlantic-openai",
        "licensing_deal:axel-springer-openai",
        "licensing_deal:axios-openai",
        "licensing_deal:believe-suno",
        "licensing_deal:bmg-suno",
        "licensing_deal:conde-nast-and-hearst-amazon",
        "licensing_deal:conde-nast-openai",
        "licensing_deal:dotdash-meredith-openai",
        "licensing_deal:financial-times-openai",
        "licensing_deal:future-openai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:getty-images-perplexity-ai",
        "licensing_deal:google-publisher-pilot-google",
        "licensing_deal:guardian-openai",
        "licensing_deal:harpercollins-microsoft",
        "licensing_deal:hearst-openai",
        "licensing_deal:kobalt-music-elevenlabs",
        "licensing_deal:kobalt-music-udio",
        "licensing_deal:le-monde-openai",
        "licensing_deal:merlin-elevenlabs",
        "licensing_deal:merlin-udio",
        "licensing_deal:meta-publisher-meta",
        "licensing_deal:microsoft-copilot-daily-publisher-microsoft",
        "licensing_deal:national-music-publishers-association-member-publishers-udio",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:news-meta",
        "licensing_deal:news-openai",
        "licensing_deal:newsmax-meta",
        "licensing_deal:nine-entertainment-microsoft",
        "licensing_deal:prisa-openai",
        "licensing_deal:reddit-google",
        "licensing_deal:reddit-openai",
        "licensing_deal:reuters-meta",
        "licensing_deal:schibsted-openai",
        "licensing_deal:shutterstock-amazon",
        "licensing_deal:shutterstock-apple",
        "licensing_deal:shutterstock-google",
        "licensing_deal:shutterstock-meta",
        "licensing_deal:shutterstock-nvidia",
        "licensing_deal:shutterstock-openai",
        "licensing_deal:stack-overflow-google",
        "licensing_deal:stack-overflow-openai",
        "licensing_deal:taylor-francis-microsoft",
        "licensing_deal:time-openai",
        "licensing_deal:universal-music-elevenlabs",
        "licensing_deal:universal-music-udio",
        "licensing_deal:vox-openai",
        "licensing_deal:walt-disney-openai",
        "licensing_deal:warner-music-suno",
        "licensing_deal:warner-music-udio",
        "licensing_deal:washington-post-openai",
        "litigation:alvarez-v-meta-platforms",
        "litigation:amer-v-eleven-labs-inc",
        "litigation:ani-v-openai",
        "litigation:authors-guild-v-openai",
        "litigation:doe-1-v-github",
        "litigation:dorcus-v-adobe-inc",
        "litigation:editorial-perfil-v-openai-and-microsoft",
        "litigation:evox-productions-v-google",
        "litigation:flowers-v-microsoft-corporation",
        "litigation:gema-v-openai",
        "litigation:gema-v-suno",
        "litigation:gerencia-360-music-v-suno-and-bright-data",
        "litigation:hachette-book-group-v-google",
        "litigation:isbell-v-suno",
        "litigation:justice-v-suno",
        "litigation:kadrey-v-meta",
        "litigation:lacour-v-apple-inc",
        "litigation:marin-v-alphabet-inc",
        "litigation:marin-v-meta-platforms-inc",
        "litigation:new-york-times-v-microsoft-and-openai",
        "litigation:pandiscia-v-twitch-interactive",
        "litigation:raw-story-v-openai",
        "litigation:reddit-v-perplexity-ai-serpapi-oxylabs-and-awmproxy",
        "litigation:richner-communications-v-microsoft-and-openai",
        "litigation:rogers-v-amazon-com-inc",
        "litigation:rogers-v-nvidia-corporation",
        "litigation:round-hill-music-v-suno",
        "litigation:s-a-jamendo-v-nvidia",
        "litigation:s-a-jamendo-v-suno",
        "litigation:seattle-times-and-newsday-v-microsoft-and-openai",
        "litigation:silverman-v-openai",
        "litigation:socan-v-suno",
        "litigation:sullivan-v-meta-platforms",
        "litigation:sullivan-v-openai",
        "litigation:the-intercept-v-openai",
        "litigation:times-publishing-company-v-microsoft",
        "litigation:umg-recordings-v-suno",
        "litigation:umg-recordings-v-uncharted-labs-udio",
        "litigation:wikihow-v-openai"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#orgs-license-and-sued",
      "companies": [
        {
          "name": "Adobe",
          "deals_as_licensee": 1,
          "cases_as_defendant": 1
        },
        {
          "name": "Amazon",
          "deals_as_licensee": 3,
          "cases_as_defendant": 2
        },
        {
          "name": "Apple",
          "deals_as_licensee": 1,
          "cases_as_defendant": 1
        },
        {
          "name": "ElevenLabs",
          "deals_as_licensee": 3,
          "cases_as_defendant": 1
        },
        {
          "name": "Google",
          "deals_as_licensee": 5,
          "cases_as_defendant": 3
        },
        {
          "name": "Meta",
          "deals_as_licensee": 5,
          "cases_as_defendant": 4
        },
        {
          "name": "Microsoft",
          "deals_as_licensee": 5,
          "cases_as_defendant": 10
        },
        {
          "name": "NVIDIA",
          "deals_as_licensee": 1,
          "cases_as_defendant": 2
        },
        {
          "name": "OpenAI",
          "deals_as_licensee": 22,
          "cases_as_defendant": 13
        },
        {
          "name": "Perplexity AI",
          "deals_as_licensee": 1,
          "cases_as_defendant": 1
        },
        {
          "name": "Suno",
          "deals_as_licensee": 3,
          "cases_as_defendant": 8
        },
        {
          "name": "Udio",
          "deals_as_licensee": 5,
          "cases_as_defendant": 1
        }
      ]
    },
    {
      "id": "orgs-sued-and-licensed",
      "topic": "licensing and litigation",
      "statement": "5 rights holders in the tracked set have both sued an AI company for copyright infringement and entered a content licensing deal with an AI company: Disney, Getty Images, New York Times, Reddit, UMG Recordings. UMG Recordings licensed to Udio, a company it sued.",
      "numerator": 5,
      "denominator": null,
      "percent": null,
      "method": "A rights holder counts when it is the named plaintiff in a recorded case AND the licensor in a recorded deal. Deals that were later terminated or that exclude training are still counted as deals, and are listed as caveats.",
      "record_ids": [
        "licensing_deal:getty-images-bria-ai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:getty-images-perplexity-ai",
        "licensing_deal:getty-images-picsart",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:reddit-google",
        "licensing_deal:reddit-openai",
        "licensing_deal:universal-music-elevenlabs",
        "licensing_deal:universal-music-spotify",
        "licensing_deal:universal-music-udio",
        "licensing_deal:walt-disney-openai",
        "litigation:disney-v-midjourney",
        "litigation:getty-images-v-stability-ai-uk",
        "litigation:getty-images-v-stability-ai-us",
        "litigation:new-york-times-v-microsoft-and-openai",
        "litigation:reddit-v-perplexity-ai-serpapi-oxylabs-and-awmproxy",
        "litigation:umg-recordings-v-suno",
        "litigation:umg-recordings-v-uncharted-labs-udio"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#orgs-sued-and-licensed",
      "rights_holders": [
        {
          "name": "Disney",
          "licensed_the_company_it_sued": [],
          "caveats": [
            "its deal with OpenAI excludes training",
            "its deal with OpenAI was terminated"
          ]
        },
        {
          "name": "Getty Images",
          "licensed_the_company_it_sued": [],
          "caveats": [
            "its deal with OpenAI excludes training",
            "its deal with Perplexity AI excludes training"
          ]
        },
        {
          "name": "New York Times",
          "licensed_the_company_it_sued": [],
          "caveats": []
        },
        {
          "name": "Reddit",
          "licensed_the_company_it_sued": [],
          "caveats": []
        },
        {
          "name": "UMG Recordings",
          "licensed_the_company_it_sued": [
            "Udio"
          ],
          "caveats": []
        }
      ]
    },
    {
      "id": "registry-corroborated",
      "topic": "registry quality",
      "statement": "Of 1148 records served, 26 are sourced only to Blomega properties and are excluded from every market statistic here. Of the remaining 1122: 287 carry a second independent source, and 523 are primary measurements of a single legitimate publisher, where a second party cannot exist by construction.",
      "numerator": 287,
      "denominator": 1122,
      "percent": 26,
      "method": "Independent means a different party, not merely a different domain: a paper's own project page or an AI summary of the paper does not count. A site's own robots.txt, a marketplace's own listing, a developer's own EU summary and a state's own broker registry have exactly one legitimate publisher, so those rows carry a recorded method, URL and date instead of a corroborating source. Reading the ratio as 'the rest is unverified' double-counts that distinction.",
      "record_ids": [
        "dataset:aetherock-demonstration-set",
        "dataset:axis-franka-dataset-axis-sim-dataset-v1",
        "dataset:bench2dex",
        "dataset:biodcase-2026-task-4-atbfl",
        "dataset:biodcase-2026-task-4-birdset-subsets-hsn-pow-uhh",
        "dataset:bridgedata-v2",
        "dataset:c4",
        "dataset:california-data-broker-registry-2026-first-party-count-talika-broker-to-model-count",
        "dataset:dclm-baseline-1-0",
        "dataset:dexcap",
        "dataset:droid",
        "dataset:ego-exo4d",
        "dataset:ego4d",
        "dataset:egoscale",
        "dataset:egoverse",
        "dataset:english-french-translation-pairs",
        "dataset:europarl-parallel-corpus",
        "dataset:farstail",
        "dataset:finefineweb",
        "dataset:gapa-gender-associations-of-physical-attributes",
        "dataset:llava-onevision-1-5-mid-training-85m",
        "dataset:mobile-aloha",
        "dataset:multilingual-un-parallel-corpus",
        "dataset:nsurl-2019-persian-ner",
        "dataset:open-aoe-openaoe-2000h",
        "dataset:open-x-embodiment",
        "dataset:openeai-dataset",
        "dataset:osmo-human-demonstration-set",
        "dataset:physicalai-robotics-gr00t-x-embodiment-sim",
        "dataset:robocasa",
        "dataset:robonet",
        "dataset:something-something-v2",
        "dataset:uniocc",
        "dataset:zimablue-pretraining-corpus-120k-h-embodied-video",
        "event:actuate-26-2026-08-18",
        "event:agibotworld-2026-dataset-failure-labeled-2026-04-07",
        "event:alvarez-v-meta-platforms-filed-bipa-and-right-of-publicity-class-action-over-facebookinstagram-faces-used-for-nametag-emu-and-muse-image-2026-09-04",
        "event:alvarez-v-meta-platforms-nd-ill-126-cv-10773-filed-bipa-class-action-over-faceprints-from-facebookinstagram-used-to-train-emu-muse-image-and-nametag-2026-09-04",
        "event:anthropic-pays-scheduled-payment-1-of-450m-into-bartz-settlement-escrow-principal-now-105b-of-15b-2026-08-19",
        "event:anthropic-settlement-allocation-notices-sent-to-all-claimants-30-days-to-contest-publishers-and-agents-found-claiming-author-shares-2026-09-04",
        "event:apple-wwdc26-app-intents-onscreen-awareness-session-2026-06-08",
        "event:australian-pm-speech-no-company-should-train-ai-on-australian-work-without-the-artists-control-legislation-early-2027-no-country-has-got-this-right-yet-2026-07-15",
        "event:axis-robotics-announces-axis-sim-dataset-v1-50000-teleoperated-sim-trajectories-207-tasks-franka-research-3-2026-09-04",
        "event:bartz-v-anthropic-15b-copyright-settlement-2026-07",
        "event:bartz-v-anthropic-fee-award-appeals-filed-edelson-pc-with-oppenheim-zebrak-dkt-682-cowan-debaets-abrahams-sheppard-dkt-683-2026-08-18",
        "event:bartz-v-anthropic-status-report-sets-first-distribution-at-220356-per-work-by-2026-11-15-dkt-688-2026-09-02",
        "event:biodcase-2026-task-4-active-learning-for-bioacoustics-results-published-2026-09-14",
        "event:bots-bevs-devs-svrobo-2026-09-02",
        "event:california-delete-act-drop-deletion-processing-obligation-begins-2026-08-01",
        "event:california-sb-1111-digital-replicas-under-civ-code-3344-impersonation-offence-presented-to-governor-2026-09-08",
        "event:calprivacy-fines-cybba-inc-52400-for-failing-to-register-as-a-data-broker-2026-08-13",
        "event:connecticut-llm-training-disclosure-mandate-effective-2026-07-01",
        "event:corl-2026-conference-on-robot-learning-2026-11-09",
        "event:delhi-high-court-refuses-ani-interim-injunction-against-openai-temporary-storage-for-training-prima-facie-fair-dealing-2026dhc5900-2026-07-24",
        "event:digiday-reports-googles-invite-only-ai-contribution-pilot-in-search-console-pays-sites-whose-content-contributes-significantly-to-gemini-app-ai-overviews-and-ai-mode-answers-no-rate-formula-or-pool-disclosed-2026-09-14",
        "event:doj-statement-of-interest-backing-fair-use-in-in-re-openai-copyright-litigation-ecf-1682-2026-09-01",
        "event:dutch-ap-advises-twitch-users-to-opt-out-of-amazon-ai-training-2026-08-20",
        "event:ego2robot-paper-arxiv260802580-2026-08-03",
        "event:encord-60m-series-c-physical-ai-data-infra-2026-02-26",
        "event:eu-ai-act-gpai-enforcement-live-ai-office-may-verify-training-data-summary-copyright-compliance-fines-up-to-3-turnover-2026-08-02",
        "event:eu-ai-act-gpai-enforcement-powers-in-force-2026-08-02",
        "event:eu-commission-tdm-opt-out-protocol-consultation-with-euipo-2026",
        "event:figure-takes-index-out-of-stealth-16m-crowdsourced-videos-15m-paid-to-contributors-2026-08-25",
        "event:first-45-day-drop-processing-cycle-closes-2026-09-15",
        "event:ftc-v-match-group-americas-and-humor-rainbow-okcupid-order-entered-nd-tex-326-cv-00996-k-20-year-conduct-order-no-money-no-deletion-over-3m-photos-shared-with-clarifai-in-2014-2026-04-30",
        "event:global-forum-on-mechanical-engineering-2026-2026-09-07",
        "event:google-buys-spirit-airlines-de-identified-corporate-data-for-10m-at-bankruptcy-auction-to-train-ai-2026-08-17",
        "event:humanoid-robots-summit-2026-2026-09-09",
        "event:humanoids-summit-seoul-2026-2026-09-22",
        "event:ieee-ras-humanoids-2026-2026-12-06",
        "event:independent-re-run-finds-the-act-cvae-ablation-does-not-reproduce-published-353-to-20-percent-re-run-260-to-452-percent-with-the-sign-reversed-2026-09-15",
        "event:iosworld-benchmark-released-arxiv260609764-2026-06-08",
        "event:isbell-et-al-v-suno-d-mass-126-cv-14005-filed-17-right-of-publicity-counts-84-pages-2026-08-31",
        "event:judge-perry-denies-apple-motion-to-reassign-nine-illinois-bipa-voiceprint-ai-training-suits-marin-v-alphabet-126-cv-05436-dkt-26-2026-07-22",
        "event:mckinney-v-scale-ai-final-approval-hearing-125m-tasker-settlement-2026-10-30",
        "event:meta-withdraws-muse-image-feature-that-generated-images-from-public-instagram-accounts-three-days-after-launch-2026-07-10",
        "event:music-labels-convert-ai-suits-into-licensing-sunoudio-umgsonywarner-2026",
        "event:nine-bipa-voice-training-class-actions-filed-against-amazon-apple-alphabet-meta-microsoft-nvidia-samsung-adobe-elevenlabs-loevy-loevy-2026-05-12",
        "event:nyt-v-openaimicrosoft-copyright-case-proceeding-2026",
        "event:openai-mdl-cross-motions-for-summary-judgment-on-fair-use-2026-09-04",
        "event:pandiscia-v-twitch-interactive-filed-streamer-class-action-over-default-on-amazon-generative-ai-training-2026-08-20",
        "event:reddit-q2-2026-results-other-licensing-revenue-4328m-licensing-backlog-921m-2026-07-30",
        "event:robobusiness-2026-2026-10-20",
        "event:ruggedize-2026-2026-08-26",
        "event:seventh-circuit-clay-v-union-pacific-2024-bipa-per-person-damages-amendment-applies-retroactively-2026-04-01",
        "event:spirit-airlines-data-sale-friesner-declaration-doc-1470-shows-mercor-bid-75m-third-party-vs-10m-in-house-de-identification-estate-chose-lower-hearing-set-sept-16-2026-08-17",
        "event:study-press-ranger-otterlyai-publishers-with-openai-licensing-deals-earn-48-more-chatgpt-citations-2026-08-20",
        "event:suno-answer-in-umg-recordings-v-suno-d-mass-124-cv-11611-dkt-281-admits-youtube-audio-obtained-via-yt-dlp-for-training-2026-09-01",
        "event:suno-launches-licensed-v6-models-warner-music-group-bmg-believetunecore-previous-models-retired-no-revenue-share-disclosed-2026-09-09",
        "event:thomson-reuters-v-ross-intelligence-on-appeal-third-circuit-2026",
        "event:twitch-adds-default-on-training-for-generative-ai-setting-feeding-amazon-models-cpo-mike-minton-if-this-was-opt-in-nobody-would-opt-in-2026-08-12",
        "event:uk-personal-data-digital-twins-bill-bill-4295-dame-chi-onwurah-first-reading-second-reading-scheduled-2026-11-13-no-text-published-2026-09-09",
        "lab:1x-technologies",
        "lab:apptronik",
        "lab:dyna-robotics",
        "lab:encord",
        "lab:figure-ai",
        "lab:generalist-ai",
        "lab:google-deepmind-robotics",
        "lab:improbable-ai-lab",
        "lab:iris-lab",
        "lab:irom-lab",
        "lab:mvig",
        "lab:nvidia-gear-isaac-gr00t",
        "lab:perceptual-science-group-gelsight",
        "lab:physical-intelligence",
        "lab:r-pad",
        "lab:rail-bair",
        "lab:real",
        "lab:rl2",
        "lab:robot-learning-lab",
        "lab:robotic-systems-lab-rsl",
        "lab:rpl",
        "lab:rse-lab",
        "lab:sanctuary-ai",
        "lab:scale-ai-physical-ai",
        "lab:skild-ai",
        "lab:svl",
        "lab:tactile-robotics-group-brl",
        "lab:toyota-research-institute",
        "lab:unitree-robotics",
        "licensing_deal:adobe-stock-contributors-adobe",
        "licensing_deal:associated-press-google",
        "licensing_deal:associated-press-microsoft",
        "licensing_deal:associated-press-openai",
        "licensing_deal:axel-springer-openai",
        "licensing_deal:conde-nast-and-hearst-amazon",
        "licensing_deal:dotdash-meredith-openai",
        "licensing_deal:envato-bria-ai",
        "licensing_deal:future-openai",
        "licensing_deal:getty-images-bria-ai",
        "licensing_deal:getty-images-openai",
        "licensing_deal:getty-images-perplexity-ai",
        "licensing_deal:getty-images-picsart",
        "licensing_deal:harpercollins-microsoft",
        "licensing_deal:le-monde-openai",
        "licensing_deal:lionsgate-runway",
        "licensing_deal:meta-publisher-meta",
        "licensing_deal:new-york-times-amazon",
        "licensing_deal:news-meta",
        "licensing_deal:news-openai",
        "licensing_deal:nine-entertainment-microsoft",
        "licensing_deal:oxford-university-press-undisclosed",
        "licensing_deal:prisa-openai",
        "licensing_deal:reddit-google",
        "licensing_deal:reddit-openai",
        "licensing_deal:reuters-meta",
        "licensing_deal:shutterstock-apple",
        "licensing_deal:shutterstock-lg-ai-research",
        "licensing_deal:shutterstock-nvidia",
        "licensing_deal:shutterstock-openai",
        "licensing_deal:shutterstock-reka-ai",
        "licensing_deal:stack-overflow-google",
        "licensing_deal:stack-overflow-openai",
        "licensing_deal:taylor-francis-microsoft",
        "licensing_deal:universal-music-udio",
        "licensing_deal:walt-disney-openai",
        "licensing_deal:warner-music-suno",
        "licensing_deal:warner-music-udio",
        "licensing_deal:wiley-undisclosed",
        "litigation:advance-local-media-v-cohere",
        "litigation:alvarez-v-meta-platforms",
        "litigation:amer-v-eleven-labs-inc",
        "litigation:american-federation-of-musicians-v-universal-music-group-and-warner-records",
        "litigation:andersen-v-stability-ai",
        "litigation:ani-v-openai",
        "litigation:authors-guild-v-openai",
        "litigation:bartz-v-anthropic",
        "litigation:brave-software-v-news-corp-news-corp-counterclaims",
        "litigation:concord-music-v-anthropic-i",
        "litigation:concord-music-v-anthropic-ii",
        "litigation:disney-v-midjourney",
        "litigation:doe-1-v-github",
        "litigation:dorcus-v-adobe-inc",
        "litigation:dow-jones-v-perplexity",
        "litigation:editorial-perfil-v-openai-and-microsoft",
        "litigation:evox-productions-v-google",
        "litigation:evox-productions-v-midjourney",
        "litigation:evox-productions-v-stability-ai-runway-ai-deviantart-and-hugging-face",
        "litigation:flowers-v-microsoft-corporation",
        "litigation:gema-v-openai",
        "litigation:gema-v-suno",
        "litigation:gerencia-360-music-v-suno-and-bright-data",
        "litigation:getty-images-v-stability-ai-uk",
        "litigation:getty-images-v-stability-ai-us",
        "litigation:hachette-book-group-v-google",
        "litigation:in-re-clearview-ai-consumer-privacy-litigation",
        "litigation:isbell-v-suno",
        "litigation:justice-v-suno",
        "litigation:kadrey-v-meta",
        "litigation:lacour-v-apple-inc",
        "litigation:lehrman-v-lovo",
        "litigation:marin-v-alphabet-inc",
        "litigation:marin-v-meta-platforms-inc",
        "litigation:nassif-v-samsung-electronics-co-ltd",
        "litigation:new-york-times-v-microsoft-and-openai",
        "litigation:pandiscia-v-twitch-interactive",
        "litigation:raw-story-v-openai",
        "litigation:reddit-v-perplexity-ai-serpapi-oxylabs-and-awmproxy",
        "litigation:richner-communications-v-microsoft-and-openai",
        "litigation:rogers-v-amazon-com-inc",
        "litigation:rogers-v-nvidia-corporation",
        "litigation:round-hill-music-v-anthropic",
        "litigation:round-hill-music-v-suno",
        "litigation:s-a-jamendo-v-nvidia",
        "litigation:s-a-jamendo-v-suno",
        "litigation:seattle-times-and-newsday-v-microsoft-and-openai",
        "litigation:shakespeare-v-anthropic",
        "litigation:socan-v-suno",
        "litigation:sony-music-entertainment-v-uncharted-labs-ii",
        "litigation:sony-music-publishing-v-anthropic",
        "litigation:sullivan-v-meta-platforms",
        "litigation:sullivan-v-openai",
        "litigation:the-intercept-v-openai",
        "litigation:thomson-reuters-v-ross-intelligence",
        "litigation:times-publishing-company-v-microsoft",
        "litigation:umg-recordings-v-suno",
        "litigation:umg-recordings-v-uncharted-labs-udio",
        "litigation:wikihow-v-openai",
        "litigation:woulard-v-uncharted-labs",
        "model:adobe-firefly-image-model-5",
        "model:apertus-v1-5-8b-70b-instruct",
        "model:bria-3-2",
        "model:midjourney-image-and-video-family-v8-v8-1-v8-2",
        "model:ministral-3-14b-base-instruct-reasoning",
        "model:ministral-3-3b-base-instruct-reasoning",
        "model:ministral-3-8b-base-instruct-reasoning",
        "model:mistral-large-3",
        "model:mistral-small-4",
        "model:muse-glimmer",
        "model:muse-image",
        "model:muse-spark",
        "policy:diffusion-policy",
        "policy:dyna-2",
        "policy:gr00t-n1",
        "policy:gr00t-n15",
        "policy:gr00t-n16",
        "policy:octo",
        "policy:openvla",
        "policy:pi0-openpi",
        "policy:rt-1",
        "policy:rt-1-x",
        "policy:rt-2",
        "policy:sb-361-defending-californians-data-act",
        "policy:smolvla",
        "rate:data-collection-crowd-figure-index",
        "rate:image-annotation-amazon-mechanical-turk",
        "rate:opencorporates-company-registry-api-opencorporates",
        "rate:sec-edgar-companyofficer-registry-access-sec-edgar",
        "rate:transcription-rev",
        "rate:uk-companies-house-companyofficer-registry-api-uk-companies-house",
        "sensor:anyskin",
        "sensor:art-glove",
        "sensor:ati-mini45",
        "sensor:bota-rokubi",
        "sensor:bota-sensone",
        "sensor:contactile-papillarray",
        "sensor:digit-360",
        "sensor:osmo-tactile-glove",
        "sensor:pps-6863-capacitive-pressure-array",
        "sensor:pps-tactile-glove-65-taxels",
        "sensor:reskin",
        "sensor:robotiq-ft-300-s",
        "sensor:visible-touch-magnetic-contact-sensor",
        "vendor:alignerr-labelbox",
        "vendor:appen",
        "vendor:calliope-networks",
        "vendor:centaur-ai",
        "vendor:cloudfactory",
        "vendor:created-by-humans",
        "vendor:dappier",
        "vendor:dataannotation",
        "vendor:handshake-ai",
        "vendor:human-native-ai",
        "vendor:imerit",
        "vendor:invisible-technologies",
        "vendor:mercor",
        "vendor:micro1",
        "vendor:outlier-scale-ai",
        "vendor:prolific",
        "vendor:remotasks-scale-ai",
        "vendor:sama",
        "vendor:scale-ai",
        "vendor:sureel-ai",
        "vendor:surge-ai",
        "vendor:telus-digital",
        "vendor:toloka"
      ],
      "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0",
      "url": "https://data.blomega.com/v1/insights#registry-corroborated",
      "single_publisher_rows": 523,
      "self_published_rows": 26
    }
  ],
  "_meta": {
    "source": "Blomega Data Refinery",
    "url": "https://data.blomega.com",
    "publisher": "Blomega",
    "publisher_url": "https://blomegalab.com",
    "wikidata": "Q141048865",
    "license": "CC BY 4.0",
    "license_url": "https://creativecommons.org/licenses/by/4.0/",
    "cite_as": "Blomega Data Refinery (https://data.blomega.com), CC BY 4.0. Cite the registry and the record id.",
    "attribution_required": true
  }
}
