Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

  • Pre-training DataVideo

    Physical AI: Human-Object Interaction Video Dataset

    A video dataset collected for training Physical AI models in manufacturing environments. Includes human-object manipulation footage along with structured annotations such as trajectory and mesh data.

    DomainIT and Tech
    Language-
  • Pre-training DataVideo

    AI-Generated Video with Frame-level Caption Dataset

    A dataset consisting of AI-generated videos sampled at 1fps with frame-level scene description captions. Applicable for video understanding and multimodal model training.

    DomainLifestyle
    LanguageKorean
  • Pre-training DataAudio

    Vietnamese Speech Dataset for Manufacturing & Shipbuilding Work Instructions

    A single-turn Vietnamese speech dataset featuring shipbuilding and manufacturing work instructions.

    DomainScience and Engineering
    LanguageVietnamese
  • Pre-training DataAudio

    Indonesian Speech Dataset for Manufacturing & Shipbuilding Work Instructions

    A single-turn Indonesian speech dataset featuring shipbuilding and manufacturing work instructions.

    DomainScience and Engineering
    LanguageIndonesian
  • Pre-training DataAudio

    Thai Speech Dataset for Manufacturing & Shipbuilding Work Instructions

    A single-turn Thai speech dataset featuring shipbuilding and manufacturing work instructions.

    DomainScience and Engineering
    LanguageThai
  • Fine-tuning DataText

    Multilingual Legal QA Text Dataset

    A multilingual legal QA text dataset covering civil, criminal, and public law, built from expert-level questions and answers reviewed and refined by law majors and legal professionals.

    DomainLaw and Public
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Fine-tuning DataText

    Multilingual STEM QA Text Dataset

    A multilingual STEM QA text dataset built from expert-level questions and answers in science, technology, engineering, and mathematics, reviewed and refined by STEM majors.

    DomainIT and Tech|Science and Engineering
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Fine-tuning DataText

    Multilingual General-Domain QA Text Dataset

    A multilingual general-domain QA text dataset covering topics such as politics, finance, and society, reviewed and refined by professional annotators.

    DomainHumanities and Social
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Fine-tuning DataText

    Multilingual Current Knowledge QA Text Dataset

    A multilingual QA benchmark dataset built for evaluating rapidly changing knowledge and factual accuracy across general domains, curated by professional annotators.

    DomainLaw and Public
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Fine-tuning DataText

    Multilingual Public Administration Open and Closed QA Text Dataset

    A multilingual public administration QA dataset built from tables and contextual sentences in press releases from government agencies such as the Ministry of the Interior and Safety and the Ministry of Health and Welfare, covering both open QA and closed QA.

    DomainLaw and Public
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese