Marathi (India) Call Center Speech Dataset for Healthcare

The audio dataset comprises call center conversations for the Healthcare domain, featuring native Marathi speakers from India. It includes speech data, detailed metadata and accurate transcriptions.

Category

Unscripted Call Center Conversations

Total Volume

40 Speech Hours

Last updated

Jun 2024

Number of participants

80

Get this Speech Dataset

Get Dataset Btn

About this Off-the-shelf Speech Dataset

About Gradiet Line

Introduction

Welcome to the Marathi Call Center Speech Dataset for the Healthcare domain designed to enhance the development of call center speech recognition models specifically for the Healthcare industry. This dataset is meticulously curated to support advanced speech recognition, natural language processing, conversational AI, and generative voice AI algorithms.

Speech Data

This training dataset comprises 40 Hours of call center audio recordings covering various topics and scenarios related to the Healthcare domain, designed to build robust and accurate customer service speech technology.

  • Participant Diversity:
  • Speakers: 80 expert native Marathi speakers from the FutureBeeAI Community.
  • Regions: Different regions of Maharashtra, ensuring a balanced representation of Marathi accents, dialects, and demographics.
  • Participant Profile: Participants range from 18 to 70 years old, representing both males and females in a 60:40 ratio, respectively.
  • Recording Details:
  • Conversation Nature: Unscripted and spontaneous conversations between call center agents and customers.
  • Call Duration: Average duration of 5 to 15 minutes per call.
  • Formats: WAV format with stereo channels, a bit depth of 16 bits, and a sample rate of 8 and 16 kHz.
  • Environment: Without background noise and without echo.
  • Topic Diversity

    This dataset offers a diverse range of conversation topics, call types, and outcomes, including both inbound and outbound calls with positive, neutral, and negative outcomes.

  • Inbound Calls:
  • Appointment Scheduling
  • New Patient Registration
  • Surgery Consultation
  • Consultation regarding Diet, and many more
  • Outbound Calls:
  • Appointment Reminder
  • Health and Wellness Subscription Programs
  • Lab Tests Results
  • Health Risk Assessments
  • Preventive Care Reminders, and many more
  • This extensive coverage ensures the dataset includes realistic call center scenarios, which is essential for developing effective customer support speech recognition models.

    Transcription

    To facilitate your workflow, the dataset includes manual verbatim transcriptions of each call center audio file in JSON format. These transcriptions feature:

  • Speaker-wise Segmentation: Time-coded segments for both agents and customers.
  • Non-Speech Labels: Tags and labels for non-speech elements.
  • Word Error Rate: Word error rate is less than 5% thanks to the dual layer of QA.
  • These ready-to-use transcriptions accelerate the development of the Healthcare domain call center conversational AI and ASR models for the Marathi language.

    Metadata

    The dataset provides comprehensive metadata for each conversation and participant:

  • Participant Metadata: Unique identifier, age, gender, country, state, district, accent and dialect.
  • Conversation Metadata: Domain, topic, call type, outcome/sentiment, bit depth, and sample rate.
  • This metadata is a powerful tool for understanding and characterizing the data, enabling informed decision-making in the development of Marathi call center speech recognition models.

    Usage and Applications

    This dataset can be used for various applications in the fields of speech recognition, natural language processing, and conversational AI, specifically tailored to the Healthcare domain. Potential use cases include:

  • Speech Recognition Models: Training and fine-tuning speech recognition models for Marathi.
  • Speech Analytics Models: Building speech analytics models to extract insights, identify patterns, and glean valuable information from customer conversation, enables data-driven decision-making and process optimization within the Healthcare sector.
  • Smart Assistants and Chatbots: Developing conversational agents and virtual assistants for customer service in the Healthcare industries.
  • Sentiment Analysis: Analyzing customer sentiment and improving customer experience based on call center interactions.
  • Generative AI: Training generative AI models capable of generating human-like responses, summaries, or content tailored to the Healthcare domain.
  • Secure and Ethical Collection

  • Our proprietary data collection and transcription platform, “Yugo” was used throughout the process of this dataset creation.
  • Throughout the data collection process, the data remained within our secure platform and did not leave our environment, ensuring data security and confidentiality.
  • The data collection process adhered to strict ethical guidelines, ensuring the privacy and consent of all participants.
  • It does not include any personally identifiable information about any participant, which makes the dataset safe to use.
  • The dataset does not contain any copyrighted content.
  • Updates and Customization

    Understanding the importance of diverse environments for robust ASR models, our call center voice dataset is regularly updated with new audio data captured in various real-world conditions.

  • Customization & Custom Collection Options:
  • Environmental Conditions: Custom collection in specific environmental conditions upon request.
  • Sample Rates: Customizable from 8kHz to 48kHz.
  • Transcription Customization: Tailored to specific guidelines and requirements.
  • License

    This Healthcare domain call center audio dataset is created by FutureBeeAI and is available for commercial use.

    Use Cases

    Use of speech data in Conversational AI

    Call Center Conversational AI

    Use of speech data for Automatic Speech Recognition

    ASR

    Use of speech data for Chatbot & voicebot creation

    Chatbot

    Use of speech data in Language Modeling

    Language Modelling

    Use of speech data in Text-into-speech

    TTS

    Speech data usecase in Speech Analytics

    Speech Analytics

    Dataset Sample(s)

    Sample Line

    ATTRIBUTES

    Channel 1Channel 2Format
    Male(22)Male(19)wav, json

    TRANSCRIPTION

    LABELSTARTENDCHANNELTRANSCRIPT
    Speech1.4432.277Speaker 1<lang:Foreign>Hello Futurebee</lang:Foreign>
    Speech3.9725.000Speaker 2<lang:Foreign>Hello Futurebee</lang:Foreign>
    Speech5.7776.971Speaker 2सुप्रभात <lang:Foreign>Doctor</lang:Foreign> <PII>जॉन</PII>
    Speech10.11110.858Speaker 1सुप्रभात <PII>टॉम</PII>
    Speech11.55712.554Speaker 1आज तुला कसं वाटतंय?
    Speech15.77819.195Speaker 2[filler] <lang:Foreign>Doctor</lang:Foreign> मला हवामानामुळे थोडसं वाईट वाटतंय.
    Speech20.92521.725Speaker 1बघतो.
    Speech22.42527.960Speaker 1आम्ही सुरुवात करण्यापूर्वी तू~तुम्ही तुमची जन्मतारीख आणि पत्ता पुष्टी करुं शकता का?
    Speech30.83233.862Speaker 2[filler] होय [filler] माझी जन्मतारीख आहे
    Speech35.31137.682Speaker 2<PII>एक, दोन, दोन हजार तीन</PII>
    Speech39.66141.712Speaker 2आणि माझा पत्ता <PII>पंचवटी,</PII>
    Speech42.86544.645Speaker 2[noise] मुंबई हा आहे.
    Speech49.02149.596Speaker 1धन्यवाद.
    Speech49.89856.523Speaker 1आता आपल्या वैद्यकीय इतिहासाबद्दल आणि आपण अनुभवत असलेल्या कोणत्याही लक्षणाबद्दल मला सांगू शकाल का?
    Speech59.46271.462Speaker 2[filler] ठीक आहे <lang:Foreign>Doctor</lang:Foreign> [filler] मला गे~ल्या काही दिवसांपासून मला खोकला आणि छातीत जडपणा जाणवत होता [filler] मला डोकेदुखी आणि घसा दुखत, डोकं आणि घसा पण दुखत आहे
    Speech73.45675.072Speaker 1अच्छा. ठीक आहे.
    Speech75.59678.081Speaker 1मला तुमचा वैद्यकीय इतिहास तपासू द्या.
    Speech80.51382.983Speaker 1मी पाहतो की तुम्हाला दम्याचा त्रास आहे.
    Speech84.19787.084Speaker 1तुम्ही तुमचे <lang:Foreign>inhaler</lang:Foreign> लिहून दिल्या प्रमाणे घेत आहात का?
    Speech90.38593.025Speaker 2[filler] होय <lang:Foreign>sir</lang:Foreign> मी ते नियमितपणे घेत आहे.
    Speech94.92495.617Speaker 1छान.
    Speech96.786100.980Speaker 1तुमच्या लक्षणांवर आधारित तुम्हाला दम्याचा त्रास होण्याची शक्यता आहे पुढे.
    Speech102.292107.319Speaker 1मला निदानाची पुष्टी करण्यासाठी शारीरिक तपासणी आणि कार्य चाचणीसाठी,
    Speech108.253110.474Speaker 1<lang:Foreign>follow up</lang:Foreign> भेटीची वेळ निश्चित करावी लागेल.
    Speech112.180117.042Speaker 1दरम्यान, मी तुमच्या श्वास नलिकेतील जळजळ कमी करण्यात मदत करण्यासाठी
    Speech118.048119.548Speaker 1<lang:Foreign>steroid</lang:Foreign>चा <lang:Foreign>course</lang:Foreign> लिहून देतो.
    Speech120.709121.209Speaker 1ठीक आहे.
    Speech123.462124.462Speaker 2[filler] ठीक आहे.
    Speech126.870128.787Speaker 1ती तुमच्या पसंतीच्या <lang:Foreign>forms</lang:Foreign> मध्ये
    Speech130.348131.401Speaker 1<lang:Foreign>prescription</lang:Foreign> पाठवीन
    Speech132.068132.793Speaker 1कृपया
    Speech133.419138.552Speaker 1लिहून दिल्या प्रमाणेऔषध घ्या आणि एका आठवड्यानंतर माझ्याकडे पाठपुरावा करण्यासाठी
    Speech139.306139.723Speaker 1या.
    Speech140.776144.721Speaker 1या दरम्यान निर्देशानुसार तुमचे <lang:Foreign>inhaler</lang:Foreign> घेणे सुरू ठेवणे आणि
    Speech145.448147.782Speaker 1दम्याचे लक्षण वाढवणारे कोणतेही कार्य
    Speech148.543149.181Speaker 1हे टाळा.
    Speech152.770154.354Speaker 2[filler] समजले <lang:Foreign>Doctor</lang:Foreign>
    Speech155.049156.687Speaker 2तुमच्या मदतीबद्दल धन्यवाद.
    Speech157.705158.336Speaker 1नक्कीच.
    Speech159.312163.453Speaker 1तुम्हाला आणखी काही शंका किंवा प्रश्न असल्यास तुम्ही मला विचारू शकता.
    Speech166.026167.793Speaker 2[noise] [filler] <lang:Foreign>Doctor</lang:Foreign>
    Speech168.193175.568Speaker 2मला माझ्या पाठीच्या खालच्या भागात काही वेदना होत आहेत आणि आता काही आठवड्यांपासून, ते मला त्रास देत आहे.
    Speech178.335179.627Speaker 1अच्छा बघतो.

    TRANSCRIPTION

    TIMETRANSCRIPT
    1.443
    2.277
    <lang:Foreign>Hello Futurebee</lang:Foreign>
    3.972
    5.000
    <lang:Foreign>Hello Futurebee</lang:Foreign>
    5.777
    6.971
    सुप्रभात <lang:Foreign>Doctor</lang:Foreign> <PII>जॉन</PII>
    10.111
    10.858
    सुप्रभात <PII>टॉम</PII>
    11.557
    12.554
    आज तुला कसं वाटतंय?
    15.778
    19.195
    [filler] <lang:Foreign>Doctor</lang:Foreign> मला हवामानामुळे थोडसं वाईट वाटतंय.
    20.925
    21.725
    बघतो.
    22.425
    27.960
    आम्ही सुरुवात करण्यापूर्वी तू~तुम्ही तुमची जन्मतारीख आणि पत्ता पुष्टी करुं शकता का?
    30.832
    33.862
    [filler] होय [filler] माझी जन्मतारीख आहे
    35.311
    37.682
    <PII>एक, दोन, दोन हजार तीन</PII>
    39.661
    41.712
    आणि माझा पत्ता <PII>पंचवटी,</PII>
    42.865
    44.645
    [noise] मुंबई हा आहे.
    49.021
    49.596
    धन्यवाद.
    49.898
    56.523
    आता आपल्या वैद्यकीय इतिहासाबद्दल आणि आपण अनुभवत असलेल्या कोणत्याही लक्षणाबद्दल मला सांगू शकाल का?
    59.462
    71.462
    [filler] ठीक आहे <lang:Foreign>Doctor</lang:Foreign> [filler] मला गे~ल्या काही दिवसांपासून मला खोकला आणि छातीत जडपणा जाणवत होता [filler] मला डोकेदुखी आणि घसा दुखत, डोकं आणि घसा पण दुखत आहे
    73.456
    75.072
    अच्छा. ठीक आहे.
    75.596
    78.081
    मला तुमचा वैद्यकीय इतिहास तपासू द्या.
    80.513
    82.983
    मी पाहतो की तुम्हाला दम्याचा त्रास आहे.
    84.197
    87.084
    तुम्ही तुमचे <lang:Foreign>inhaler</lang:Foreign> लिहून दिल्या प्रमाणे घेत आहात का?
    90.385
    93.025
    [filler] होय <lang:Foreign>sir</lang:Foreign> मी ते नियमितपणे घेत आहे.
    94.924
    95.617
    छान.
    96.786
    100.980
    तुमच्या लक्षणांवर आधारित तुम्हाला दम्याचा त्रास होण्याची शक्यता आहे पुढे.
    102.292
    107.319
    मला निदानाची पुष्टी करण्यासाठी शारीरिक तपासणी आणि कार्य चाचणीसाठी,
    108.253
    110.474
    <lang:Foreign>follow up</lang:Foreign> भेटीची वेळ निश्चित करावी लागेल.
    112.180
    117.042
    दरम्यान, मी तुमच्या श्वास नलिकेतील जळजळ कमी करण्यात मदत करण्यासाठी
    118.048
    119.548
    <lang:Foreign>steroid</lang:Foreign>चा <lang:Foreign>course</lang:Foreign> लिहून देतो.
    120.709
    121.209
    ठीक आहे.
    123.462
    124.462
    [filler] ठीक आहे.
    126.870
    128.787
    ती तुमच्या पसंतीच्या <lang:Foreign>forms</lang:Foreign> मध्ये
    130.348
    131.401
    <lang:Foreign>prescription</lang:Foreign> पाठवीन
    132.068
    132.793
    कृपया
    133.419
    138.552
    लिहून दिल्या प्रमाणेऔषध घ्या आणि एका आठवड्यानंतर माझ्याकडे पाठपुरावा करण्यासाठी
    139.306
    139.723
    या.
    140.776
    144.721
    या दरम्यान निर्देशानुसार तुमचे <lang:Foreign>inhaler</lang:Foreign> घेणे सुरू ठेवणे आणि
    145.448
    147.782
    दम्याचे लक्षण वाढवणारे कोणतेही कार्य
    148.543
    149.181
    हे टाळा.
    152.770
    154.354
    [filler] समजले <lang:Foreign>Doctor</lang:Foreign>
    155.049
    156.687
    तुमच्या मदतीबद्दल धन्यवाद.
    157.705
    158.336
    नक्कीच.
    159.312
    163.453
    तुम्हाला आणखी काही शंका किंवा प्रश्न असल्यास तुम्ही मला विचारू शकता.
    166.026
    167.793
    [noise] [filler] <lang:Foreign>Doctor</lang:Foreign>
    168.193
    175.568
    मला माझ्या पाठीच्या खालच्या भागात काही वेदना होत आहेत आणि आता काही आठवड्यांपासून, ते मला त्रास देत आहे.
    178.335
    179.627
    अच्छा बघतो.

    Dataset Demographics

    Details Headline

    Language

    Marathi

    Language code

    mr-in

    Country

    India

    Accents

    Varhadi,...more

    Gender Distribution

    M:60, F:40

    Age Group

    18-70

    Audio File Details

    Details Headline

    Environment

    Silent, Noisy

    Bit Depth

    16 bit

    Format

    wav

    Sample rate

    8khz & 16khz

    Channel

    Stereo

    Audio file duration

    5-15 minutes

    Download Sample Speech Dataset Now!

    Explore Audio Data, Metadata and Transcription to get more clarity and hands on experience of this dataset.

    Download Free Dataset

    Audio Download Btn
    Audio Promp Bg
    Audio Promp Bg

    Start your AI/ML model creation journey with FutureBeeAI!

    Contact Us

    Audio Arrow BtnAudio Arrow Btn Black
    Audio Promp 2 Bg