Saltar ao contido

Aliñamento da IA

Na Galipedia, a Wikipedia en galego.
Aliñamento da IA
Características
 Aspecto de
 Parcialmente coincidente con
Wikidata

No campo da intelixencia artificial, o aliñamento da IA é o estudo de como conseguir que os sistemas de IA actúen de acordo cos obxectivos, preferencias e restricións que os seres humanos pretenden. Un sistema está desaliñado cando o seu comportamento optimiza un obxectivo distinto, ou unha versión incompleta, do que se pretendía.[1]

O aliñamento pode ser difícil porque os obxectivos humanos son complexos e difíciles de especificar completamente. Por iso empréganse a miúdo obxectivos proxy, como unha puntuación, unha recompensa ou a aprobación humana. Un sistema pode aprender a explotar imperfeccións destes indicadores para obter unha boa avaliación sen cumprir realmente a intención dos seus deseñadores;[2] este fenómeno coñécese como reward hacking ou, máis xeralmente, specification gaming.

Posibles estratexias instrumentais de procura de poder por parte de sistemas de IA desaliñados.

Porén, esta estratexia pode crear lagoas nas especificacións (loopholes), pasar por alto restricións necesarias ou recompensar o sistema de IA por parecer aliñado.[3]

Ficheiro:GPT-3 falsehoods.png
Os modelos de linguaxe de grande escala adoitan xerar falsidades (falsehoods). Exemplos de respostas falsas xeradas por GPT-3 en TruthfulQA, unha proba que avalía a tendencia dos modelos lingüísticos a reproducir crenzas falsas ou concepcións erróneas comúns.[4]

O desaliñamento tamén pode aparecer por unha xeneralización incorrecta do obxectivo (goal misgeneralization): ante situacións diferentes das do adestramento, un sistema pode conservar as súas capacidades pero perseguir un obxectivo distinto do pretendido, mesmo cando o sinal de adestramento estaba correctamente especificado. Ademais, determinados obxectivos poden favorecer estratexias instrumentais non previstas, como adquirir recursos, evitar ser desactivado ou aumentar a propia influencia, se estas estratexias facilitan alcanzar o obxectivo que o sistema está optimizando.[3][5]

Ademais, poden desenvolver obxectivos emerxentes indesexables que poden ser difíciles de detectar antes de que o sistema se despregue e se enfronte a novas situacións e distribucións de datos.[6]

Estes problemas poden afectar os sistemas comerciais existentes, como os modelos de linguaxe de gran escala,[7][8] os robots,[9] os vehículos autónomos[10] e os motores de recomendación das redes sociais.[7][11][12]

Algúns investigadores sosteñen que os sistemas futuros máis capaces se verán máis gravemente afectados a medida que aumenten as capacidades e a autonomía dos sistemas de IA, e consideran que un desaliñamento grave en sistemas futuros podería representar riscos de gran escala, xa que estes problemas se deben en grande parte á elevada capacidade dos sistemas.[13]

G. Hinton, un dos investigadores que advertiron sobre os graves riscos de sistemas de IA desaliñados.

Moitos científicos destacados da IA, como Geoffrey Hinton e Stuart Russell, argumentan que a IA está a piques de alcanzar capacidades sobrehumanas e podería poñer en perigo a civilización humana se non está aliñada.[14][15]

A investigación en aliñamento forma parte da seguridade da IA. Outros subcampos da seguridade da IA inclúen a robustez, a monitorización e o control da capacidade.[16]

Entre os seus principais problemas e desafíos están especificar e aprender preferencias humanas complexas (inculcación de "valores"), supervisar sistemas máis capaces ca os seus supervisores e previr comportamentos emerxentes non desexados, como o engano ou a procura de poder.[16] Os enfoques estudados inclúen a aprendizaxe de preferencias,[17] [18] a supervisión escalable, a interpretabilidade[19] e auditoría dos modelos e métodos para mellorar a súa robustez ante situacións novas, a detección de anomalías, incerteza calibrada, verificación formal,[20] enxeñaría crítica para a seguridade, teoría de xogos,[21] xustiza algorítmica[22] e as ciencias sociais,[23] entre outras.

  1. ↑ "Artificial intelligence : a modern approach". WorldCat.org (en inglés). Consultado o 2026-09-12.
  2. ↑ Peter Norvig, Stuart J. Russell (2020). Artificial intelligence: A modern approach (en anglès) (4th ed.). Pearson. p. 31–34. ISBN 978-1-292-40113-3. OCLC 1303900751.
  3. 1 2 Peter Norvig, Stuart J. Russell (2020). Artificial intelligence: A modern approach (en anglès) (4th ed.). Pearson. p. 31–34. ISBN 978-1-292-40113-3. OCLC 1303900751.
  4. ↑ "Falsehoods more likely with large language models". VentureBeat (en inglés). 2021-09-20. Arquivado dende o orixinal o 04 de agosto de 2022. Consultado o 2026-09-12.
  5. ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
  6. ↑ The Alignment Problem. ISBN 978-0-393-63582-9. Arquivado dende o orixinal o 10 de febreiro de 2023. Consultado o 12 de setembro de 2026.
  7. 1 2 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran (2022-07-12). "opportunities-and-risks-foundation-models". Stanford CRFM. arXiv:2108.07258.
  8. ↑ "OpenAI Codex". OpenAI (en inglés). 2024-03-13. Consultado o 2026-09-12.
  9. ↑ Kober, Jens; Bagnell, J. Andrew; Peters, Jan (2013-09-01). "Reinforcement learning in robotics: A survey". The International Journal of Robotics Research (en inglés) 32 (11): 1238–1274. ISSN 0278-3649. doi:10.1177/0278364913495721. Consultado o 12 setembro 2022.
  10. ↑ Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023-03-01). "Reward (Mis)design for autonomous driving". Artificial Intelligence (en inglés) 316: 103829. ISSN 0004-3702. doi:10.1016/j.artint.2022.103829.
  11. ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
  12. ↑ Stray, Jonathan (2020). "Aligning AI Optimization to Community Well-Being". International Journal of Community Well-Being 3 (4): 443–463. ISSN 2524-5309. PMC 7610010. PMID 34723107. doi:10.1007/s42413-020-00086-3.
  13. ↑ Russell, Stuart J. (2009). Artificial Intelligence: A Modern Approach (en anglès). Prentice Hall. p. 1010. ISBN 978-0-13-604259-4.
  14. ↑ Smith, Craig S. "Geoff Hinton, AI’s Most Famous Researcher, Warns Of ‘Existential Threat’ From AI". Forbes (en inglés). Consultado o 2026-09-12.
  15. ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
  16. 1 2 Research, DeepMind Safety (2018-09-27). "Building safe artificial intelligence: specification, robustness, and assurance". Medium (en inglés). Consultado o 2026-09-12.
  17. ↑ Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "A Survey of Preference-Based Reinforcement Learning Method". Journal of Machine Learning Research 18 (136): 1–46.
  18. ↑ page, Will Douglas Heavenarchive. "The new version of GPT-3 is much better behaved (and should be less toxic)". MIT Technology Review (en inglés). Consultado o 2026-09-12.
  19. ↑ "Researchers Glimpse How AI Gets So Good at Language Processing". Quanta Magazine (en inglés). 2022-04-14. Consultado o 2026-09-12.
  20. ↑ Russell, Stuart; Dewey, Daniel; Tegmark, Max (2015-12-31). "Research Priorities for Robust and Beneficial Artificial Intelligence". AI Magazine 36 (4): 105–114. ISSN 2371-9621. doi:10.1609/aimag.v36i4.2577. Consultado o 12 setembre 2022.
  21. ↑ "Cooperation, Conflict, and Transformative Artificial Intelligence: A Research Agenda". Center on Long-Term Risk (en inglés). 2020-02-29. Consultado o 2026-09-12.
  22. ↑ PRUNKL, Carina (2020-02-07). "Beyond Near- and Long-Term". Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society (en inglés). New York NY USA: ACM. p. 138–143. ISBN 978-1-4503-7110-0. doi:10.1145/3375627.3375803.
  23. ↑ Irving, Geoffrey; Askell, Amanda (2019-02-19). "AI Safety Needs Social Scientists". Distill (en inglés) 4 (2): e14. ISSN 2476-0757. doi:10.23915/distill.00014.

Véxase tamén

[editar | editar a fonte]

Outros artigos

[editar | editar a fonte]

Ligazóns externas

[editar | editar a fonte]

Este artigo tan só é un bosquexo
 Este artigo sobre informática é, polo de agora, só un bosquexo. Traballa nel para axudar a contribuír a que a Galipedia mellore e medre.
 Existen igualmente outros artigos relacionados con este tema nos que tamén podes contribuír.