PaLM
| Тип | велика мовна модель |
|---|---|
| Розробник | Google AI |
| Доступні мови | Англійська |
| Вебсайт | ai |
PaLM (Pathways Language Model — це велика мовна модель (LLM) на основі виключно декодувального трансформера, що містить 540 мільярдів параметрів, розроблена Google AI[1]. Дослідники також навчили менші версії PaLM (з 8 та 62 мільярдами параметрів), щоб перевірити вплив масштабу моделі[2].
PaLM здатний виконувати широкий спектр завдань, включаючи міркування на основі здорового глузду, арифметичні міркування, пояснення жартів, генерацію коду та переклад[2][3][4][5]. У поєднанні з промптами у вигляді ланцюжка думок, PaLM досяг значно кращої продуктивності на наборах даних, що вимагають багатоетапного міркування, таких як текстові задачі та логічні питання[1][2].
Модель була вперше анонсована у квітні 2022 року та залишалася приватною до березня 2023 року, коли Google запустила API для PaLM та кількох інших технологій[6]. API спочатку був доступний обмеженій кількості розробників, які приєдналися до списку очікування, перш ніж його було випущено для публіки[7].
Google та DeepMind розробили версію PaLM 540B (з 540 мільярдами параметрів) під назвою Med-PaLM, яка тонко налаштована на медичні дані та перевершує попередні моделі за показниками медичних тестів на відповіді на запитання[8][9]. Med-PaLM першою отримала прохідний бал за питання медичної ліцензії в США, і, окрім того, що вона точно відповідає як на питання з вибором однієї правильної відповіді, так і на питання з відкритою відповіддю, вона надає обґрунтування та здатна оцінювати власні відповіді[10].
Google також розширила PaLM за допомогою зорового трансформера для створення PaLM-E, зорової моделі, яку можна використовувати для роботизованих маніпуляцій без необхідності перенавчання чи точного налаштування[11][12][13].
У травні 2023 року Google анонсувала PaLM 2 на щорічному виступі Google I/O[14]. Повідомляється, що PaLM 2 — це модель з 340 мільярдами параметрів, навчена на 3,6 трильйонах токенів[15].
У червні 2023 року Google анонсувала AudioPaLM для перекладу мовлення, яка використовує архітектуру та ініціалізацію PaLM-2[16].
PaLM попередньо навчено на високоякісному корпусі з 780 мільярдів токенів, які містять різні завдання природної мови та варіанти використання. Цей набір даних включає відфільтровані веб-сторінки, книги, статті Вікіпедії, новинні статті, вихідний код, отриманий з репозиторіїв з відкритим кодом на GitHub, та розмови в соціальних мережах[1][2]. Вона базується на наборі даних, який використовується для навчання моделі LaMDA від Google[2]. Частка набору даних, що стосується розмов у соціальних мережах, становить 50 % корпусу, що допомагає моделі у її розмовних можливостях[2].
PaLM 540B навчався на двох подах TPU v4 з 3072 мікросхемами TPU v4 у кожному, підключеними до 768 хостів, з'єднаних за допомогою комбінації паралелізму моделі та даних, що було найбільшою конфігурацією TPU[2][17]. Це дозволило ефективно навчати в такому масштабі, використовуючи 6144 мікросхеми, та стало рекордом найвищої ефективності навчання, досягнутої для LLM такого масштабу: використання апаратних FLOPs на рівні 57,8 %[3].
- 1 2 3 Narang, Sharan; Chowdhery, Aakanksha. Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance. ai.googleblog.com (англ.). Процитовано 17 березня 2023.
- 1 2 3 4 5 6 7 Chowdhery, Aakanksha; Narang, Sharan (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311 [cs.CL].
- 1 2 Anadiotis, George (12 квітня 2022). Google sets the bar for AI language models with PaLM. VentureBeat. Процитовано 17 березня 2023.
- ↑ Bastian, Matthias (5 квітня 2022). Google PaLM: Giant language AI can explain jokes. the decoder. Процитовано 17 березня 2023.
- ↑ Google: Why Is No One Talking About PaLM. seekingalpha.com (англ.). 12 грудня 2022. Процитовано 17 березня 2023.
- ↑ Vincent, James (14 березня 2023). Google opens up its AI language model PaLM to challenge OpenAI and GPT-3. The Verge. Процитовано 17 березня 2023.
- ↑ Huffman, Scott; Woodward, Josh. PaLM API & MakerSuite: an approachable way to start prototyping and building generative AI applications (англ.). Процитовано 17 березня 2023.
- ↑ Singhal, Karan; Azizi, Shekoofeh (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138 [cs.CL].
- ↑ MedPaLM: New Chatbots Will Soon Be Better Than Waiting For A Doctor. The Medical Futurist. 17 січня 2023. Процитовано 17 березня 2023.
- ↑ Matias, Yossi; Corrado, Greg (14 березня 2023). Our latest health AI research updates. Google (амер.). Процитовано 17 березня 2023.
- ↑ Driess, Danny; Xia, Fei (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378 [cs.LG].
- ↑ Driess, Danny; Florence, Pete. PaLM-E: An embodied multimodal language model. ai.googleblog.com (англ.). Процитовано 17 березня 2023.
- ↑ Edwards, Benj (7 березня 2023). Google's PaLM-E is a generalist robot brain that takes commands. Ars Technica (амер.). Процитовано 17 березня 2023.
- ↑ Lardinois, Frederic (10 травня 2023). Google launches PaLM 2, its next-gen large language model. TechCrunch. Архів оригіналу за 10 травня 2023. Процитовано 10 травня 2023.
- ↑ Elias, Jennifer (16 травня 2023). Google's newest A.I. model uses nearly five times more text data for training than its predecessor. CNBC. Процитовано 18 травня 2023.
- ↑ AudioPaLM. google-research.github.io. Процитовано 30 червня 2023.
- ↑ Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob та ін. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311 [cs.CL].
