Интересные обсуждения

темы заинтересовавшие velkin

Как Google изобрёл Трансформеры

VladD2 VladD2
https://share.google/aimode/iG467MuFy15aColIw

Как Google изобрёл Трансформеры, всё проспал и невольно запустил ИИ-революцию


Навеяло тут мыслями о "Дилемме инноватора" и текущем состоянии ИИ-рынка. Хочу зафиксировать в одном месте удивительный парадокс: как корпоративная косность, бюрократия и страх потерять рекламные миллиарды со стороны Google стали главным драйвером мирового технологического прогресса.

По сути, Google породил своих главных конкурентов вопреки собственной воле. Выделил ключевые тезисы этой драмы:

1. Почему технологию не узурпировали сразу?
Когда в 2017 году вышла легендарная статья "Attention Is All You Need", менеджмент Google просто не понял масштаба открытия. Архитектуру Transformer создавали для сугубо прикладной задачи — улучшения Google Переводчика. В академической ИИ-среде тогда царила культура Open Source, поэтому статью выложили в открытый доступ. Засекретить математику механизма Self-Attention никто не догадался.

2. Синдром "Дилеммы Инноватора" и перестраховка
Google — заложник своей бизнес-модели. Основной доход компании — это реклама в поисковой выдаче (десять синих ссылок). Чат-бот, дающий один конкретный ответ, эту модель уничтожает. Корпорация панически боялась:
  • сломать свою "дойную корову";
  • репутационных рисков (если ИИ выдаст фейк или оскорбление, акции упадут).
В итоге рабочие модели годами пылились на серверах из-за бесконечных согласований с юристами и комитетами по этике. Молодому стартапу OpenAI терять было нечего, они рискнули, выкатили ChatGPT в 2022 году и сорвали банк.

3. Великий исход: "Восьмёрка Трансформеров" и Нобелевские лауреаты
Бюрократия создала невыносимые условия для создателей. Учёные уходили из Google не за деньгами, а за возможностью созидать. На сегодняшний день ни один из 8 авторов оригинальной статьи не работает в Google. Они основали топ-стартапы: OpenAI (Лукаш Кайзер), Cohere (Эйдан Гомес), Character.ai (Ноам Шазир), NEAR Protocol (Илья Полосухин).

Утечка мозгов продолжается по сей день. Из свежего:

Летом 2026 года Джон Джампер (создатель AlphaFold и Нобелевский лауреат) ушёл из Google DeepMind в Anthropic. А в августе 2026 года саму DeepMind перетряхнуло: Демис Хассабис ушёл с поста CEO на позицию председателя, а Джефф Дин покинул корпорацию после 27 лет работы.


Вывод

Классический пример из истории бизнеса в духе Xerox PARC или Kodak. Глупость (недальновидность менеджеров) и жадность (защита рекламных бюджетов) заставили Google перестраховываться. Если бы Google был гибким, он стал бы абсолютным ИИ-монополистом и задушил бы рынок. Но их закостенелость вытолкнула гениев наружу, породив мощнейшую конкуренцию, которая сейчас и тащит весь ИИ-прогресс вперёд на космической скорости.

Google повторяет историю IBM? Эта музыка будет вечной?
Артём
Артём Attention Is All You Need
06.09.2026 01:20
Здравствуйте, VladD2, Вы писали:

VD>Как Google изобрёл Трансформеры, всё проспал и невольно запустил ИИ-революцию


В Гугле сидят многие тысячи программистов, ресёрч выпустили несколько человек и сделан он был для автопереводчика. Ибо только ленивый тогда не пинал гугловский автопереводчик за тупизну. Первый результат- российскую ABBY — на то время лидера мирового рынка автопереводчиков- раздавило катком, пока они инвестировали "на все" в умную оптимальную языковую модель, не жгущую тысячи киловатт электричества видеокартами.

Через 2-3 года в OpenAI долумались выкинуть половину из изначально гугловской схемы автопереводчика, и тренировать на огромных объёмах текстов. Без открытия в Гугле не было бы LLM в нынешнем виде, но то было другая штука с другим применением.

PS Интересно, что выгорит у ЛеКуна с его Жеппой- убийцей LLM.
VladD2
VladD2
06.09.2026 01:48
Здравствуйте, Артём, Вы писали:

Аё>Через 2-3 года в OpenAI долумались выкинуть половину из изначально гугловской схемы автопереводчика, и тренировать на огромных объёмах текстов. Без открытия в Гугле не было бы LLM в нынешнем виде, но то было другая штука с другим применением.


https://share.google/aimode/PKP49LfIWOSKkekRs
Артём
Артём
06.09.2026 04:49
Здравствуйте, VladD2, Вы писали:

VD>https://share.google/aimode/PKP49LfIWOSKkekRs


Imho — ABBY пилили-пилили свою красивую схему по старым канонам, а открытие обрезанного трансформера случилось много позже и случайно. Неслучайно в исследования вливались огромные деньги инвесторов Силиконки- трансгуманистов, ещё задолго до прорыва с LLM, они ожидали и пытались приблизить наступление AGI / сингулярности. ЛеКун утверждает, что LLM не способен достичь сингулярности и продвигает JEPA.
Nuzhny
Nuzhny
06.09.2026 08:15
Здравствуйте, VladD2, Вы писали:

VD>https://share.google/aimode/PKP49LfIWOSKkekRs


С JEPA есть и третий сценарий — гибридный. Уже сейчас LLM — это не текстовые, а мульт модальные сети. Для картинок и видео у них используется энкодер типа CLIP. Пробовали менять его на эмбеддинг от JEPA и качество росло довольно значительно. Никто не мешает использовать эмбеддинги ЛеКуна внутри трансформеров LLM.

Кроме CLIP, есть ещё другие визуальные эмбеддинг от Меты — это Dino, которые как раз команда ЛеКуна и делала на основе своей концепции. И они офигенный, массово используются в компьютерном зрении. То есть его идея явно стоящая и уже используется в промышленности.
Вот это и есть гибридный сценарий, когда часть идей войдёт (уже вошла) в повседневную жизнь.

Но это только кусочек общей концепции, которая есть аналог принцип Свободной энергии из нейробиологи (не из физики!). И этот принцип подразумевает не пассивную работу (вход — анализ — выход), а активную:
1. Есть модель мира.
2. Есть датчики-входы.
3. Есть действия, которые минимизируют ошибку между моделью мира и входом.
4. Модель мира меняется онлайн в соответствии с входом.

Концепция очень крутая, выглядит очень перспективно и очень сложно. Не просто так ЛеКуну миллиард отсыпали.
VladD2
VladD2
07.09.2026 10:31
Здравствуйте, Nuzhny, Вы писали:

N>Пробовали менять его на эмбеддинг от JEPA и качество росло довольно значительно. Никто не мешает использовать эмбеддинги ЛеКуна внутри трансформеров LLM.


Так что же не используют, а используют этот самый CLIP?

N>Концепция очень крутая, выглядит очень перспективно и очень сложно. Не просто так ЛеКуну миллиард отсыпали.


По живем, увидим. Пока что оно не взлетает почему-то. Но может тут (как с кучей технологий находящихся в тени корпоративной бездарности) люди просто не видят очевидного живя по принципу не у бигтека ничего хорошего быть не может.
Nuzhny
Nuzhny
07.09.2026 11:09
Здравствуйте, VladD2, Вы писали:

N>>Пробовали менять его на эмбеддинг от JEPA и качество росло довольно значительно. Никто не мешает использовать эмбеддинги ЛеКуна внутри трансформеров LLM.

VD>Так что же не используют, а используют этот самый CLIP?

CLIP придумали сами OpenAI, сделали это раньше и он изначально обучался на парах изображение-текст. Поэтому его не надо отдельно затачивать для LLM, делая её мультимодальной. Грубо говоря, эта модель делает из картинки такие же эмбеддинги, что и текстовые.

DINO и DINOv2 (по принципу JEPA, но не до конца) дела Мета попозже для задач исключительно компьютерного зрения, они там быстро превзошли CLIP практически во всех задачах. DINOv3 намного круче, но уже с ограниченной лицензией для коммерческого использования.
Но они обучались без текста, поэтому напрямую в LLM не засунуть, только через обучаемую прокладку.
Работы ведутся и публикуются, результаты хорошие.

VD>По живем, увидим. Пока что оно не взлетает почему-то. Но может тут (как с кучей технологий находящихся в тени корпоративной бездарности) люди просто не видят очевидного живя по принципу не у бигтека ничего хорошего быть не может.


Тут причина больше в том, что это сильно сложнее делать. Если у трансформеров описан закон их масштабируемости и он пока что реально работает: больше данных, больше сеть -> лучше результат. То есть можно брать деньги инвесторам и показывать гарантированный результат по качеству.
С новыми архитектурами больше рисков и в них вкладываются не так охотно, хотя и выглядят они перспективно.
Но да — увидим. Илья Суцкевер тоже обещал скорое появление AGI со своей стороны.
velkin
velkin Attention Is All You Need
06.09.2026 11:59
Здравствуйте, VladD2, Вы писали:

VD>Как Google изобрёл Трансформеры, всё проспал и невольно запустил ИИ-революцию


Вот смотри.

Google_Книги

В 2005 году Гильдия авторов и ряд других издателей подали коллективный иск против Google, обвинив компанию в несанкционированном сканировании защищённых авторским правом материалов. Судебный процесс продолжался до 2016 года, после чего суд принял решение в пользу Google, определив, что сканирование материалов соответствует принципу добросовестного использования. Однако из-за нерешённых правовых споров оцифровка значительно замедлилась. По состоянию на 2023 год остаётся неясным, продолжает ли компания оцифровывать библиотечные издания.


Далее.

Минюст США поддержал обучение ИИ на защищенных авторским правом текстах, сославшись на угрозу национальной безопасности

Минюст США поддержал позицию разработчиков искусственного интеллекта о том, что использование защищенных авторским правом текстов для обучения языковых моделей само по себе не нарушает законодательство. В официальной позиции, поданной 1 сентября в федеральный суд Манхэттена в рамках разбирательства против OpenAI, ведомство заявило, что ограничения, значительно затрудняющие развитие американской AI-индустрии, могут угрожать национальной безопасности США и давать преимущество иностранным конкурентам.


Я ещё раньше читал, что ради поддержки нейронок в США им разрешили забить на авторские права и дали защиту на сколько-то там лет. Могли ли Google, что-то сделать находясь под судами? Я думаю, что нет. Но вот теперь у них развязаны руки.

Теперь о доступности. Лично мне как жителю России без ограничений доступны.
https://www.google.com/aimode
https://chat.deepseek.com

Замечу, что та же Google Gemini мне недоступна как и все остальные нейросети в США. Понятное дело это без всяких извращений. Хотя сами извращения уже наводят на мысли о том, что сервис, которого тебя могут в любой момент лишить не кажется чем-то надёжным с точки зрения бизнеса.

Дальше два сценария.
1. Нейронки работают полностью в автоматическом режиме.
2. Нейронки требуют участия людей.

Во втором случае компании США со своей закрытостью, элитарностью, да ещё и платностью проиграют другим нейронкам. Тем даже не нужно быть какими-то элитарными, нужно просто быть не совсем стрёмными.

А ещё не забывай, что на подходе компьютеры с разделяемой памятью, что так же станут конкурентами дискретным видеокартам для локальных нейронок. Уже много десятилетий корпы имеют преимущество перед обычными людьми, потому что могут просто купить робота, станок с ЧПУ и так далее. Ну вот тебе нейронки, что дальше?

Дальше корпы точно так же выигрывают, потому что могут купить себе собственное оборудование. Заметь, даже не обратиться к облачным провайдерам. Облачные провайдеры это для простого народа, который готов скидывать свои разработки в нейронку сразу теряя конкурентное преимущество.

Проиграл ли Google? А я уже написал, что для меня в открытом доступе есть или Google в режиме поиска или китайский чат DeepSeek. Корпы это корпы, а обычные люди вроде меня это обычные люди. OpenAI, ChatGPT и прочие не безальтернативны.

Если бы у меня было куча денег, то я бы нанял кучу людей. Они бы на меня херачили. Если бы я хотел сохранить секреты и опять же был при деньгах, то создал бы свой небольшой локальный сервер с нейронками.

Посмотрим, что будет, когда искусственный бум спадёт и датацентры достигнут предела по количеству клиентов и электричеству, а деньги у инвесторов закончатся. Продавцы лопат, то есть процессорных чипов и памяти в любом случае будут на коне. Задел у них сейчас очень большой.
Nuzhny
Nuzhny
07.09.2026 10:00
Здравствуйте, velkin, Вы писали:

V>Проиграл ли Google? А я уже написал, что для меня в открытом доступе есть или Google в режиме поиска или китайский чат DeepSeek. Корпы это корпы, а обычные люди вроде меня это обычные люди. OpenAI, ChatGPT и прочие не безальтернативны.


Я так понимаю, что проигрыш для Гугла состоит не в том, будут ли пользоваться его LLM или нет, а будут ли пользоваться в принципе его поиском люди, которым можно показать рекламу. Тот факт, что они в топ ответов вставили не золотой баннер от рекламодателей, а ответ своей LLM говорит больше об их отчаянии в тот конкретный момент. Зачем что-то гуглить и выбирать из нерелевантных данных крупицы полезного, если тебе на блюдечке принесут разжёванный ответ?

И это не только лишь проблема Гугла. Зачем лазать по магазинам, есть ИИ-агент сможет сделать это сам и выдать тебе самое подходящее? Реклама и выгода уходят от поисковиков и сайтов по мере того, как агенты становятся умнее и автономнее.
dsorokin
dsorokin Attention Is All You Need
07.09.2026 05:11
Здравствуйте, VladD2, Вы писали:

VD>Вывод


VD>Классический пример из истории бизнеса в духе Xerox PARC или Kodak. Глупость (недальновидность менеджеров) и жадность (защита рекламных бюджетов) заставили Google перестраховываться. Если бы Google был гибким, он стал бы абсолютным ИИ-монополистом и задушил бы рынок. Но их закостенелость вытолкнула гениев наружу, породив мощнейшую конкуренцию, которая сейчас и тащит весь ИИ-прогресс вперёд на космической скорости.


VD>Google повторяет историю IBM? Эта музыка будет вечной?


Не очень разбираюсь в технических деталях вашего обсуждения, но замечу пару вещей.

Корпорации, даже самые огромные, состоят из людей. Масштабные новые вещи практически всегда двигают очень амбициозные люди, которые, мягко говоря, не в ладах с корпоративной культурой... И такие люди часто создают новые корпорации во главе с собой. Круг замыкается.

Ну, а внутри самих корпораций на место амбициозных создателей-фаундеров приходят совсем другого склада люди, которые больше про менеджерство, иерархию, правила, вечные собрания там, agile, scrum и тому подобное. А бывает, что приходят на главные посты и любители театральных выступлений с массой зрителей. Еще бывает, что такие азартные ребята приходят, что готовы взяться за все дела сразу, а потом успешно про них забыть.

И что самое главное, новым амбициозным людям со стороны, но предлагающим масштабные инновации, обычно места уже нет в чужих корпорациях... Ну, не подходят они под корпоративные правила, где нужно уметь подчиняться строго по иерархической лестнице, а с этим умением подчиняться у них обычно очень большие проблемы. Не той системы они, короче, хотя им деньги зарабатывать тоже где-то нужно, и им все же приходится идти наниматься к кому-то. Ну, вот такая жизнь.

Поэтому чему тут удивляться, что на месте старых корпораций рождаются новые? Этот круговорот постоянно повторяется
Michael7
Michael7 Attention Is All You Need
08.09.2026 02:26
Здравствуйте, VladD2, Вы писали:

VD> Засекретить математику механизма Self-Attention никто не догадался.


Тогда в 2017-м году просто никто не понял истинного потенциала механизма Self-Attention. И еще минимум с пару лет оно сильно неочевидно было. Кстати, одного SA мало, надо было еще и архитектуру не просто трансформеров, а еще и GPT изобрести. Просто трансформеры есть кучи разных BERT-образных моделей, они даже могут быть очень хорошими в своих нишах, но настоящую революцию совершил GPT.

VD>В итоге рабочие модели годами пылились на серверах из-за бесконечных согласований с юристами и комитетами по этике. Молодому стартапу OpenAI терять было нечего, они рискнули, выкатили ChatGPT в 2022 году и сорвали банк.


Первая GPT (не ChatGPT) была выпущена в 2018-м году, имела 117M-параметров с контекстом 512 токенов, большое внимание (каламбур) на себя не обратила. А вот GPT-2 появилась в июне 2019-го года, имела 1.5B-параметров и контекстом 1024 токена, стала первым прорывом, правда до обывателей значение не дошло, но это как бы не первая модель, которая смогла генерировать длинные связные тексты (с большим галлюцинированием конечно), притом на обучении на неразмеченных данных. Кстати, первая модель, которую OpenAI (скорее уже CloseAI) долго раздумывала выкладывать или нет, в итоге выложили, но сильно не сразу, емнип, полные версии стали доступны только в 2020-м.

Ну а дальше GPT-3 с 175B-параметров, 2048 токенов. В июне 2020-го года. Ее веса до сих пор не выложены, хотя по современным меркам модель уже сильно устарела, контекст просто никакой и тп.

ChatGPT в 2022-м году — это дообученная по технологии RLHF GPT-3, к которой приделали диалоговый интерфейс и выставили публично. RLHF — это значит модель учили на многочисленных диалогах "правильно" себя вести. По трудоемкости, кстати, как бы не сложнее чем просто чистое обучение. Ну собственно и понеслось. Хотя кстати, Copilot на Github появился немного раньше. Впрочем, его тогда мало, кто оценил.
VladD2
VladD2
08.09.2026 06:53
Здравствуйте, Michael7, Вы писали:

M>Тогда в 2017-м году просто никто не понял истинного потенциала механизма Self-Attention. И еще минимум с пару лет оно сильно неочевидно было. Кстати, одного SA мало, надо было еще и архитектуру не просто трансформеров, а еще и GPT изобрести. Просто трансформеры есть кучи разных BERT-образных моделей, они даже могут быть очень хорошими в своих нишах, но настоящую революцию совершил GPT.


Дык в GPT T — это и есть Трасформер. Не было бы T, не было и GP. И если отбросить формальности гугловый Трасформер тоже предобучали. Фактически OpenAI просто придумали разбить этот процесс на два этапа и оказалось, что энкодер не нужен. То есть, несомненно вклад OpenAI огромен, но специалисты ушедшие из Гугла собственно и хотели это сделать внутри гугла, но манагёры их не поняли, не оценили всю мощь технологии и в итоге все просрали.
SkyDance
SkyDance Attention Is All You Need
08.09.2026 05:27
VD>Google повторяет историю IBM? Эта музыка будет вечной?

Вроде уже обсуждали.
Корпорации всегда повторяют жизненный цикл человека. Молодость, зрелость, старость. Скорость изменений соответствует эпохе. Если какой-нибудь Standard Oil мог стареть сотню лет, то у Гугла столько времени не будет. Вопрос лишь, как скоро и чем именно корпорация будет болеть.