Video Experimental Relacionado
Updated: Feb 19, 2026

Author Spotlight: AI-Driven Trypanosome Species Detection from Microscopic Images
Published on: October 27, 2023
Un conjunto de datos para la clasificación de código fuente escrito por humanos y generado por IA
Ghizlane Boukili1, Said El Garouani1, Jamal Riffi1
1LISAC Laboratory, Faculty of Sciences Dhar El Mahraz, Sidi Mohammed Ben Abdellah University, Fez, 30003, Morocco.
Un nuevo conjunto de datos de 10,000 muestras de código ayuda a detectar el código generado por IA. Este recurso ayuda a los educadores de informática a distinguir entre la programación humana y la de inteligencia artificial, mejorando la integridad académica.
Área de la Ciencia:
- Ciencias de la Computación
- Inteligencia Artificial
- Aprendizaje Automático
Sus antecedentes:
- Las herramientas de generación de código de IA plantean desafíos para verificar la autenticidad de los estudiantes en la educación en informática.
- Las herramientas de detección de IA genéricas existentes son insuficientes para identificar con precisión el código generado por IA debido a las especificidades del lenguaje de programación.
Objetivo del estudio:
- Introducir un conjunto de datos especializado para el desarrollo de herramientas de detección de código de IA específicas del dominio.
- Abordar la brecha en los recursos para la investigación de la detección de código generado por IA.
Principales métodos:
- Creación de un conjunto de datos con 10,000 muestras de código anotadas (5000 escritas por humanos, 5000 generadas por IA).
- Inclusión de muestras en Python, Java, C y C++.
- Muestras generadas por IA producidas a través de la API de ChatGPT; muestras humanas obtenidas de repositorios públicos.
- Cada muestra etiquetada por origen (humano o IA) para el entrenamiento del modelo.
Principales resultados:
- El conjunto de datos permite el entrenamiento robusto de modelos de aprendizaje automático y aprendizaje profundo para la discriminación de la fuente del código.
- Facilita el desarrollo de herramientas especializadas para la detección de código generado por IA.
Conclusiones:
- El conjunto de datos especializado es crucial para avanzar en la investigación de la detección de código generado por IA.
- La disponibilidad pública del conjunto de datos y el código experimental apoya la investigación futura y el desarrollo de herramientas.
Videos de Conceptos Relacionados
Classification of Systems-I
Homogeneity dictates that if an input x(t) is multiplied by a constant c, the output y(t) is multiplied by the same constant. Mathematically, this is expressed as:
Non-equilibrium in the Cell
Aggregates Classification
Petrographic classification groups aggregates based on common mineralogical characteristics. Some of the common mineral groups found in aggregates are...
Classification of Systems-II
Methods of Documentation I: Source-Oriented Records
In an SOR, each discipline involved in patient care maintains a separate medical record section. This record-keeping method enables easy tracking of patient progress and ensures healthcare staff have access to up-to-date information.
Key Attributes include the following:
How Data are Classified: Categorical Data
Data are classified based on whether they are measurable or not. Categorical data cannot be measured; instead, it can be divided into categories. For example, if Y denotes a person's party affiliation, some examples of Y include...