Related Experiment Video
Updated: Jun 20, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Large language models for generating longitudinal synthetic data in low-risk pregnancy care
Gonçalo Pinto1, Vítor Crista1, Regina Silva1,2
1GECAD, ISEP, Polytechnic of Porto, Rua Dr. António Bernardino de Almeida, 4249-015, Porto, Portugal.
A synthetic obstetric dataset for 5000 low-risk pregnancies was created using a large language model. This dataset aids research in maternal care pathways and machine learning, but not clinical decisions.
Area of Science:
- Medical Informatics
- Artificial Intelligence in Healthcare
- Reproductive Medicine
Background:
- Access to comprehensive obstetric data is limited due to privacy and logistical constraints.
- Synthetic data generation offers a potential solution to overcome these limitations.
- Longitudinal data is crucial for understanding the continuum of obstetric care.
Purpose of the Study:
- To describe the generation and validation of a synthetic obstetric dataset.
- To provide a resource for research in maternal health, simulation studies, and machine learning development.
- To address data access and privacy concerns in obstetric research.
Main Methods:
- Utilized a large language model with zero-shot prompting and iterative prompt engineering.
- Defined a longitudinal schema, essential variables, and domain-specific generation rules.
- Incorporated expert feedback from General and Family Medicine and Data Science panels for refinement.
- Performed rule-based and plausibility-oriented validation for internal coherence and clinical assumptions.
Main Results:
- Generated a synthetic obstetric dataset for 5000 low-risk pregnant women, covering preconception to post-birth.
- Dataset includes trimester-specific clinical measurements (e.g., gestational weight, hemoglobin) and perinatal variables (e.g., consultations, delivery outcomes).
- Validated dataset ensures statistical coherence and clinical plausibility, mitigating privacy issues.
Conclusions:
- The synthetic obstetric dataset effectively overcomes data access and privacy barriers.
- This resource is suitable for simulation studies, methodological development, benchmarking, and educational machine learning.
- The dataset is not intended for direct clinical decision-making or model deployment in clinical settings.
Related Concept Videos
Longitudinal Research
Longitudinal Studies
Improving Translational Accuracy
Improving Translational Accuracy
Statistical Software for Data Analysis and Clinical Trials
Statistical Methods for Analyzing Epidemiological Data