Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

  • Pre-training DataAudio

    English-Vietnamese Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Vietnamese utterances, designed for training Speech-to-Speech translation models.

    DomainAd and Marketing
    LanguageEnglish|Vietnamese
  • Pre-training DataAudio

    English-Indonesian Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Indonesian utterances, designed for training Speech-to-Speech translation models.

    DomainAd and Marketing
    LanguageEnglish|Indonesian
  • Pre-training DataAudio

    Japanese Natural Dialogue Speech Dataset

    A speech dataset containing natural two-party dialogues in Japanese. It captures everyday conversational flow, intonation, and turn-taking timing, suitable for training general-purpose speech recognition and dialogue models.

    DomainLifestyle
    LanguageJapanese
  • Pre-training DataAudio

    English-Korean Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Korean utterances, designed for training Speech-to-Speech translation models.

    DomainAd and Marketing
    LanguageEnglish|Korean
  • Pre-training DataVideo

    Physical AI Egocentric Dataset: Pick-Place-Recover

    A video dataset of Pick-Place-Recover actions using various objects in everyday environments for Physical AI model training. Includes ECoT annotations, hand keypoint and skeleton visualization videos, and structured metadata such as trajectory data.

    DomainLifestyle
    Language-
  • Frontier DataText

    Multilingual Chain-of-Thought Reasoning Text Dataset

    A multilingual chain-of-thought reasoning dataset built from complex problems requiring step-by-step decomposition and coherent answer generation, with AI-generated drafts reviewed by expert-level annotators.

    DomainHumanities and Social|Science and Engineering
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Frontier DataText

    Expert CoT Text Dataset

    An expert chain-of-thought text dataset built from expert verbal reasoning to support LLM training for step-by-step reasoning.

    DomainAd and Marketing|Sports, Arts and Culture|Games|Humanities and Social|IT and Tech|Law and Public|Medical|Management, Economic and Finance
    LanguageKorean
  • Frontier DataText

    Doctoral Exam Questions and Solutions Text Dataset

    A high-difficulty text dataset built from doctoral-level exam questions and solutions to support LLM training for expert reasoning and problem solving.

    DomainScience and Engineering
    LanguageEnglish
  • Frontier DataText

    Domain-Specific Benchmark Dataset

    A multi-turn benchmark dataset built by benchmarking BFCL to evaluate agent action performance across finance, legal, medical, manufacturing, and defense domains.

    DomainHumanities and Social|IT and Tech|Medical|Management, Economic and Finance|Ad and Marketing|Science and Engineering|Law and Public
    LanguageEnglish
  • Frontier DataText

    Safety Response Multi-turn Dataset

    A multi-turn conversational dataset designed to evaluate model response capabilities against major safety risk categories and attack patterns.

    DomainHumanities and Social|IT and Tech|Medical|Bio, Environment and Energy|Education|Management, Economic and Finance|Ad and Marketing|Sports, Arts and Culture|Science and Engineering|Law and Public|Lifestyle
    LanguageEnglish