Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

  • Pre-training DataText

    Indonesian General-Domain Multi-Turn Chat Text Dataset

    An Indonesian general-domain multi-turn chat text dataset built by professional annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageIndonesian
  • Pre-training DataText

    Italian General-Domain Multi-Turn Chat Text Dataset

    An Italian general-domain multi-turn chat text dataset built by professional annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageItalian
  • Pre-training DataText

    Japanese General-Domain Multi-Turn Chat Text Dataset

    A Japanese general-domain multi-turn chat text dataset built by professional annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageJapanese
  • Pre-training DataText

    Spanish General-Domain Multi-Turn Chat Text Dataset

    A Spanish general-domain multi-turn chat text dataset built by professional annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageSpanish
  • Pre-training DataText

    Vietnamese General-Domain Multi-Turn Chat Text Dataset

    A Vietnamese general-domain multi-turn chat text dataset built by professional annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageVietnamese
  • Pre-training DataText

    Parallel Translation Corpus Text Dataset

    A parallel translation corpus dataset built from Korean source texts and corresponding foreign-language translations across general domains, created by professional translators and native-language annotators.

    DomainHumanities and Social
    LanguageKorean|Arabic|Chinese (Simplified)|English|French|German|Hindi|Indonesian|Japanese|Lithuanian|Malay|Portuguese|Russian|Spanish|Thai|Turkish|Vietnamese|Tagalog|Nepali
  • Pre-training DataText

    Multilingual Food and Menu Parallel Translation Corpus

    A multilingual food and menu parallel translation corpus built by translating menu names extracted from sources such as AI Hub, the Korea Tourism Organization, and ImageLab into Korean, English, Chinese, and Japanese, with expert review by translators and native-language annotators.

    DomainLifestyle
    LanguageKorean|Chinese (Simplified)|English|Japanese
  • Fine-tuning DataText

    Korean Healthcare and Bio Domain LLM Question Collection Text Dataset

    A Korean healthcare and bio domain question collection dataset built for LLM training, with questions directly collected and curated by medical and biotechnology majors and industry professionals.

    DomainMedical|Bio, Environment and Energy
    LanguageKorean
  • Fine-tuning DataText

    Korean Construction and Engineering Domain LLM Question Collection Text Dataset

    A Korean construction and engineering domain question collection dataset built for LLM training, with questions directly collected and curated by relevant majors and industry professionals.

    DomainScience and Engineering
    LanguageKorean
  • Fine-tuning DataText

    Korean Education Domain LLM Question Collection Text Dataset

    A Korean education domain question collection dataset built for LLM training, with domain-specific questions directly collected and curated by professional annotators.

    DomainEducation
    LanguageKorean