Aliñamento da IA
| Aliñamento da IA | |||||||
|---|---|---|---|---|---|---|---|
| |||||||
| |||||||
| Wikidata |
No campo da intelixencia artificial, o aliñamento da IA é o estudo de como conseguir que os sistemas de IA actúen de acordo cos obxectivos, preferencias e restricións que os seres humanos pretenden. Un sistema está desaliñado cando o seu comportamento optimiza un obxectivo distinto, ou unha versión incompleta, do que se pretendía.[1]
O aliñamento pode ser difícil porque os obxectivos humanos son complexos e difíciles de especificar completamente. Por iso empréganse a miúdo obxectivos proxy, como unha puntuación, unha recompensa ou a aprobación humana. Un sistema pode aprender a explotar imperfeccións destes indicadores para obter unha boa avaliación sen cumprir realmente a intención dos seus deseñadores;[2] este fenómeno coñécese como reward hacking ou, máis xeralmente, specification gaming.

Porén, esta estratexia pode crear lagoas nas especificacións (loopholes), pasar por alto restricións necesarias ou recompensar o sistema de IA por parecer aliñado.[3]
O desaliñamento tamén pode aparecer por unha xeneralización incorrecta do obxectivo (goal misgeneralization): ante situacións diferentes das do adestramento, un sistema pode conservar as súas capacidades pero perseguir un obxectivo distinto do pretendido, mesmo cando o sinal de adestramento estaba correctamente especificado. Ademais, determinados obxectivos poden favorecer estratexias instrumentais non previstas, como adquirir recursos, evitar ser desactivado ou aumentar a propia influencia, se estas estratexias facilitan alcanzar o obxectivo que o sistema está optimizando.[3][5]
Ademais, poden desenvolver obxectivos emerxentes indesexables que poden ser difíciles de detectar antes de que o sistema se despregue e se enfronte a novas situacións e distribucións de datos.[6]
Estes problemas poden afectar os sistemas comerciais existentes, como os modelos de linguaxe de gran escala,[7][8] os robots,[9] os vehículos autónomos[10] e os motores de recomendación das redes sociais.[7][11][12]
Algúns investigadores sosteñen que os sistemas futuros máis capaces se verán máis gravemente afectados a medida que aumenten as capacidades e a autonomía dos sistemas de IA, e consideran que un desaliñamento grave en sistemas futuros podería representar riscos de gran escala, xa que estes problemas se deben en grande parte á elevada capacidade dos sistemas.[13]

Moitos científicos destacados da IA, como Geoffrey Hinton e Stuart Russell, argumentan que a IA está a piques de alcanzar capacidades sobrehumanas e podería poñer en perigo a civilización humana se non está aliñada.[14][15]
A investigación en aliñamento forma parte da seguridade da IA. Outros subcampos da seguridade da IA inclúen a robustez, a monitorización e o control da capacidade.[16]
Entre os seus principais problemas e desafíos están especificar e aprender preferencias humanas complexas (inculcación de "valores"), supervisar sistemas máis capaces ca os seus supervisores e previr comportamentos emerxentes non desexados, como o engano ou a procura de poder.[16] Os enfoques estudados inclúen a aprendizaxe de preferencias,[17] [18] a supervisión escalable, a interpretabilidade[19] e auditoría dos modelos e métodos para mellorar a súa robustez ante situacións novas, a detección de anomalías, incerteza calibrada, verificación formal,[20] enxeñaría crítica para a seguridade, teoría de xogos,[21] xustiza algorítmica[22] e as ciencias sociais,[23] entre outras.
Notas
[editar | editar a fonte]- ↑ "Artificial intelligence : a modern approach". WorldCat.org (en inglés). Consultado o 2026-09-12.
- ↑ Peter Norvig, Stuart J. Russell (2020). Artificial intelligence: A modern approach (en anglès) (4th ed.). Pearson. p. 31–34. ISBN 978-1-292-40113-3. OCLC 1303900751.
- 1 2 Peter Norvig, Stuart J. Russell (2020). Artificial intelligence: A modern approach (en anglès) (4th ed.). Pearson. p. 31–34. ISBN 978-1-292-40113-3. OCLC 1303900751.
- ↑ "Falsehoods more likely with large language models". VentureBeat (en inglés). 2021-09-20. Arquivado dende o orixinal o 04 de agosto de 2022. Consultado o 2026-09-12.
- ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
- ↑ The Alignment Problem. ISBN 978-0-393-63582-9. Arquivado dende o orixinal o 10 de febreiro de 2023. Consultado o 12 de setembro de 2026.
- 1 2 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran (2022-07-12). "opportunities-and-risks-foundation-models". Stanford CRFM. arXiv:2108.07258.
- ↑ "OpenAI Codex". OpenAI (en inglés). 2024-03-13. Consultado o 2026-09-12.
- ↑ Kober, Jens; Bagnell, J. Andrew; Peters, Jan (2013-09-01). "Reinforcement learning in robotics: A survey". The International Journal of Robotics Research (en inglés) 32 (11): 1238–1274. ISSN 0278-3649. doi:10.1177/0278364913495721. Consultado o 12 setembro 2022.
- ↑ Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023-03-01). "Reward (Mis)design for autonomous driving". Artificial Intelligence (en inglés) 316: 103829. ISSN 0004-3702. doi:10.1016/j.artint.2022.103829.
- ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
- ↑ Stray, Jonathan (2020). "Aligning AI Optimization to Community Well-Being". International Journal of Community Well-Being 3 (4): 443–463. ISSN 2524-5309. PMC 7610010. PMID 34723107. doi:10.1007/s42413-020-00086-3.
- ↑ Russell, Stuart J. (2009). Artificial Intelligence: A Modern Approach (en anglès). Prentice Hall. p. 1010. ISBN 978-0-13-604259-4.
- ↑ Smith, Craig S. "Geoff Hinton, AI’s Most Famous Researcher, Warns Of ‘Existential Threat’ From AI". Forbes (en inglés). Consultado o 2026-09-12.
- ↑ Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control (en anglès). Penguin Random House. ISBN 9780525558637. OCLC 1113410915.
- 1 2 Research, DeepMind Safety (2018-09-27). "Building safe artificial intelligence: specification, robustness, and assurance". Medium (en inglés). Consultado o 2026-09-12.
- ↑ Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "A Survey of Preference-Based Reinforcement Learning Method". Journal of Machine Learning Research 18 (136): 1–46.
- ↑ page, Will Douglas Heavenarchive. "The new version of GPT-3 is much better behaved (and should be less toxic)". MIT Technology Review (en inglés). Consultado o 2026-09-12.
- ↑ "Researchers Glimpse How AI Gets So Good at Language Processing". Quanta Magazine (en inglés). 2022-04-14. Consultado o 2026-09-12.
- ↑ Russell, Stuart; Dewey, Daniel; Tegmark, Max (2015-12-31). "Research Priorities for Robust and Beneficial Artificial Intelligence". AI Magazine 36 (4): 105–114. ISSN 2371-9621. doi:10.1609/aimag.v36i4.2577. Consultado o 12 setembre 2022.
- ↑ "Cooperation, Conflict, and Transformative Artificial Intelligence: A Research Agenda". Center on Long-Term Risk (en inglés). 2020-02-29. Consultado o 2026-09-12.
- ↑ PRUNKL, Carina (2020-02-07). "Beyond Near- and Long-Term". Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society (en inglés). New York NY USA: ACM. p. 138–143. ISBN 978-1-4503-7110-0. doi:10.1145/3375627.3375803.
- ↑ Irving, Geoffrey; Askell, Amanda (2019-02-19). "AI Safety Needs Social Scientists". Distill (en inglés) 4 (2): e14. ISSN 2476-0757. doi:10.23915/distill.00014.
Véxase tamén
[editar | editar a fonte]| Wikimedia Commons ten máis contidos multimedia na categoría: Aliñamento da IA |
Outros artigos
[editar | editar a fonte]Ligazóns externas
[editar | editar a fonte] Este artigo sobre informática é, polo de agora, só un bosquexo. Traballa nel para axudar a contribuír a que a Galipedia mellore e medre. Existen igualmente outros artigos relacionados con este tema nos que tamén podes contribuír. |