Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

  • Pre-training DataAudio

    North African Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the North African Arabic (Maghrebi Arabic) dialect.

    DomainLaw and Public
    LanguageArabic (Morocco)|Arabic (Algeria)|Arabic (Tunisia)|Arabic (Libya)|Arabic (Mauritania)
  • Pre-training DataAudio

    Egyptian Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the Egyptian Arabic dialect.

    DomainLaw and Public
    LanguageArabic (Egypt)
  • Alignment DataImage

    Arabic Construction Image Captioning and Preference QA Dataset

    A multimodal Arabic image dataset combining image captions and preference QA for general and construction domains, reviewed and annotated by construction and engineering domain experts.

    DomainScience and Engineering|Humanities and Social
    LanguageArabic
  • Pre-training DataText

    Multilingual Multi-Turn Chat Text Dataset

    A multilingual multi-turn chat text dataset built directly by professional annotators, including speaker information, proper nouns, chat slang, typo tags, and natural conversational turns.

    DomainHumanities and Social
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Pre-training DataText

    Multilingual Domain-Specific Parallel Translation Corpus Text Dataset

    A multilingual domain-specific parallel translation corpus dataset built from Korean-to-English, Korean-to-Arabic, and Korean-to-Chinese translations specialized in military, finance, and legal domains, curated by expert annotators.

    DomainLaw and Public
    LanguageKorean|Bengali|Hindi|Indonesian|Japanese|Thai|Arabic (United Arab Emirates)|Arabic (Egypt)
  • Evaluation DataText

    General Arena Benchmark Dataset

    A Korean-based Arena benchmark text dataset built for evaluating AI model performance in general-domain comparison tasks.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean
  • Evaluation DataText

    General BFCL 3v Benchmark Dataset

    A Korean-based BFCL 3v benchmark text dataset built for evaluating function-calling capabilities of AI models.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean
  • Evaluation DataText

    General BFCL 4v Benchmark Dataset

    A Korean-based BFCL 4v benchmark text dataset built for evaluating function-calling capabilities of AI models.

    DomainIT and Tech|Science and Engineering
    LanguageKorean
  • Evaluation DataText

    General Tau Benchmark Dataset

    A Korean-based Tau benchmark text dataset built for evaluating AI model performance in benchmark tasks.

    DomainHumanities and Social|IT and Tech|Education|Management, Economic and Finance|Ad and Marketing|Lifestyle
    LanguageKorean
  • Alignment DataText

    General Preference Evaluation Chat Arena Single-Turn Dataset

    A Korean-based Chat Arena preference evaluation single-turn dataset built by collecting human preferences for AI model responses.

    DomainHumanities and Social|IT and Tech|Medical|Bio, Environment and Energy|Education|Management, Economic and Finance|Ad and Marketing|Sports, Arts and Culture|Science and Engineering|Law and Public|Lifestyle
    LanguageKorean