Video Experimental Relacionado
Updated: Sep 10, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
CODEIPPROMPT: Evaluación de la infracción de la propiedad intelectual de los modelos de lenguaje de código
Zhiyuan Yu1, Yuhao Wu1, Ning Zhang1
1Washington University in St. Louis.
Los grandes modelos de lenguaje (LM) para la generación de código a menudo violan los derechos de propiedad intelectual (PI) debido a los datos de capacitación. Nuestra plataforma, CODEIPPROMPT, evalúa y destaca estos riesgos de propiedad intelectual en el código generado por IA.
Área de la Ciencia:
- Inteligencia artificial
- Ingeniería de software
- Derecho de la propiedad intelectual
Sus antecedentes:
- Los modelos de lenguaje grande (LM) demuestran capacidades avanzadas en la síntesis de código de programación.
- El aumento del código generado por IA plantea preocupaciones significativas con respecto a las violaciones de los derechos de propiedad intelectual (PI).
- La exploración de las cuestiones de propiedad intelectual en los LM generadores de código sigue siendo un área relativamente poco explorada.
Objetivo del estudio:
- Introducir CODEIPPROMPT, una nueva plataforma para la evaluación automática de las violaciones de los derechos de propiedad intelectual en el código generado por LMs.
- Evaluar en qué medida los LM reproducen programas con licencia e identificar posibles infracciones de propiedad intelectual.
- Investigar las causas profundas de las violaciones de la propiedad intelectual en el código LM y explorar estrategias de mitigación.
Principales métodos:
- Desarrollo de CODEIPPROMPT, con indicaciones derivadas de una base de datos de códigos con licencia para activar la generación de códigos que violan la propiedad intelectual.
- Implementación de una herramienta de medición dentro de CODEIPPROMPT para cuantificar el grado de violación de PI en el código generado por LM.
- Evaluación extensa de varios LM de código abierto y comerciales utilizando la plataforma CODEIPPROMPT.
Principales resultados:
- Se observó una prevalencia de violaciones de PI en todos los LM de código abierto y comercial evaluados.
- La causa principal identificada es la inclusión significativa de código con licencia restrictiva dentro de los conjuntos de datos de capacitación.
- Tanto la inclusión intencional como las prácticas de licencia inconsistentes en el mundo real contribuyen al problema.
Conclusiones:
- CODEIPPROMPT sirve como un banco de pruebas crucial para evaluar los riesgos de violación de PI en las plataformas actuales de generación de código.
- El estudio subraya la necesidad urgente de mejorar las estrategias de mitigación para abordar las preocupaciones de PI en la síntesis de código de IA.
- El ajuste fino y el filtrado dinámico de tokens se exploran como métodos potenciales para reducir las infracciones de PI.
Más Videos Relacionados
10:11Portable Intermodal Preferential Looking IPL: Investigating Language Comprehension in Typically Developing Toddlers and Young Children with Autism
Published on: December 14, 2012
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
Videos de Conceptos Relacionados
Legal Guidelines for Documentation
Models, Theories, and Laws
Higher Mental Functions of the Brain: Language
Language formation and comprehension take place in the dominant hemisphere. The dominant hemisphere is responsible for understanding the meaning of spoken, written, or sign language, as well as the ability to communicate. For most people, the left hemisphere is the dominant one. The right hemisphere, then, gives tone and emotional context to the...
Genetic Lingo
Components of Language
Stereotype Content Model