Ресурсы: техническое описание TLS, LaTeX - в картинки (img), криптографическая библиотека Arduino, шифр "Кузнечик" на ассемблере AMD64/AVX и ARM64
Попробовал использовать ChatGPT в качестве инструмента для перевода технического текста с русского на английский, чтобы понять, насколько эта система годится для подобных задач. Может, – хотя бы, – пойдёт на роль генератора качественного “подстрочника”. ChatGPT 5 тут же “перевело” слово “совпадают” как совпides – да, “тяни-толкай” из двух слов разных языков. Это, очевидно, “склейка” из “совпадает” и coincides. Довольно забавно. ChatGPT утверждает, что это опечатка. В принципе, бывает, кто бы спорил.
К сожалению, первый вариант перевода оказался просто переписанным на английский русским текстом – то есть, это, как бы, более или менее корректный перевод (за вычетом совпides и пр.), но он читается “на русском”, а не на английском: наследованы все верхнеуровневые конструкции – это будет сильно коробить носителей английского, например. Впрочем, в качестве подстрочника – очень даже неплохо, тем более, что никто не просил литературный перевод. А до литературного, конечно, получилось космически далеко. Но ведь утверждают, что при помощи LLM переводят литературные произведения. Чтобы представить, что там получается, указал в своём ответе на то, что тут остался русский текст, но “английскими словами”, попросил переписать на английском английском. Второй вариант – оказался заметно лучше, но, к сожалению, всё ещё далёк от ожиданий “сверхинтеллекта”.
Вот хороший пример: предложение (в контексте большего текста) “Хуже того, этот кто-то может заменить пакеты или изменить передаваемые в них данные” – ChatGPT 5 переводит так: “Worse still, an attacker can modify or replace those packets”. Оставим за скобками “an attacker”, которого тут нет в исходном тексте – это не страшно. Но здесь сохранено “worse still”, – калька с русского “хуже того”. На английском – “worse still” читается как весьма драматический заход. Куда сильнее, чем “хуже того”, даже посильнее, чем “хуже всего”. Могло бы быть что-то вроде “in fact” или “moreover”. Самое забавное, что ChatGPT об этом, как бы, “знает”. Вот эти два варианта, – “in fact”, “moreover” – предложило само ChatGPT, когда я указал, что “worse still” – плохой “loan translation” (“прямое заимствование”, калька). То есть, система “знает” верные слова, но не может их выставить. Всё из-за того, что это синонимайзер, к сожалению. И “совпides” тому примером.
Но как подстрочник – вполне неплохо, факт. Продолжаем наблюдать.
Комментарии (1) »
Превращения слов. Систему Kubernetes на русском ИТ-жаргоне очень часто называют “Куб” или “Кубик”. Что, конечно, довольно забавно, потому что это дважды трансформированное из греческого через английский “фонетическое сокращение”. Дело в том, что исходное древнегреческое κυβερνήτης (“рулевой, кормчий, управляющий”) соответствует русскому “губернатор”. Так что должно быть не “куб” (которое, из-за “кубических мер”, много в каких жаргонах и арго фигурирует, но с другими значениями), а “губер”.
Комментарии (4) »
Из серии “Кто бы сомневался!”: в Project Zero публикуют описание того, как, проэксплуатировав две уязвимости (CVE-2025-54957, CVE-2025-36934), им удалось выполнить на android-устройстве произвольный код с правами ядра ОС. Тут самое интересное не уязвимости, а то, что данную атаку на уровень 0-click (то есть, без участия пользователя) переводит наличие в смартфоне ИИ-агента, читающего входящие сообщения.
Вектор атаки требует, чтобы библиотека кодека прочитала специально подготовленный звуковой файл. Для этого нужно открыть и почитать вложение к входящему сообщению SMS/RCS. Раньше для этого пользователь должен был кликнуть на сообщение и попытаться открыть его. Но теперь за пользователя всё удачно делает ИИ-агент, встроенный в гугловый сервис и выполняющий транскрибирование всех голосовых сообщений.
Вот поэтому попадает в серию “Кто бы сомневался!”. Как говорится: эти ИИ-агенты – они и эксплоиты будут вместо пользователя на его устройстве запускать. Максимальная автоматизация.
Комментарии (1) »
Попросил (на английском) ChatGPT 5 объяснить, почему в русском языке форма множественного числа слова “дно” используется для обозначения “жены дона”. Это такая шутка. ChatGPT, ранее, в другой ветке, заявляло мне, что владеет русским на высочайшем уровне, не хуже образованных носителей, так что запрос – по теме.
Однако ChatGPT заявило, в весьма пространных объяснениях, которые я не стану тут приводить, что это не так, не используется “дно” для “жены дона”. Потому что – внимание! – множественное число для “дно” – “днá” (именно так, с диакритическим знаком ударения над “a”). И ChatGPT привело пример:
одно́ дно́,
мно́го днá.
Так-то. Ну а “жена дона” – это “донна”. И дальше ChatGPT объяснило, мол, юмор тут в том, что “люди в шутку говорят: жена дона – это дна”.
А когда я написал, что, получается, это ChatGPT не знает форму множественного числа для “дно”, ответом было уверенное “I do” (“Я знаю”), со смайликом. После чего ChatGPT повторило, буквально, следующее:
The plural of дно́ is днá (stress on the second syllable):
одно́ дно́
два / три / мно́го днá
Это довольно забавно. Ударение, главное, в “днá” – на втором слоге. Не перепутайте. А самое смешное, так это слово, которое ИИ ChatGPT приводит в качестве иллюстрации того, что в русском есть и другие “контринтуитивные множественные”: “око́ → очá”.
Конечно, все эти современные говорилки, по сравнению с временами “хлопка от шампанского” и “личинок, блокирующих собачку в замке”, сильно продвинулись. ChatGPT, надо сказать, годится в качестве неплохого инструмента для поиска необычных примеров в текстах (ну, в тех случаях, когда LLM не выдумывает ответ). К сожалению, использовать этот инструмент для обработки естественного языка нужно с большой осторожностью. А при изучении иностранного языка – это, опять же, так себе помощник. Пример с “дном” и “доньей” хорошо это показывает.
Несомненно, “дно” – это весьма сложный случай. Обычно, вопрос про множественное число для “дна” ставит в тупик носителей русского, даже если они получили профильное (да, как ни странно) образование (литераторы, журналисты, иногда и филологи). Но ни одному образованному носителю русского не придёт в голову утверждать, что множественное для “дно” – “дна”. Именно в этом и состоит тупик: в совершенстве владеющий языком человек сразу понимает, что “дна” – никак не может быть множественным для “дно”; это будет не на русском. Другое дело – генератор текстов, у которого нет и не может быть понимания языка. Но “хайпу” это не мешает.
А множественное для “дно” – “донья”. Например, “сетчатые донья для ульев”.
Комментировать »
IACR – это Международная ассоциация криптологических исследований (International Association for Cryptologic Research). Результаты очередных выборов руководства и секретариата этой организации не могут расшифровать, потому что одним из доверенных лиц потерян ключ. Для расшифрования результатов голосования нужны ключи трёх доверенных лиц, однако есть ключи только двух, третий ключ – утрачен “в результате человеческой ошибки”, поэтому подсчитать результаты голосования не представляется возможным.
Это, вообще говоря, правильно: было бы странно, если бы или ключ как-то можно было восстановить, или, – что ещё хуже, – подсчитать результаты без одного из необходимых ключей. (То есть, тут примерно тот же случай, как то, что основным, необходимым признаком действительно безопасного “мессенджера” является невозможность централизованно восстановить доступ при утрате ключа.)
Выборы в IACR планируют провести заново. Только смущает один забавный момент: голосование проводится в некой системе “электронного голосования” Helios. Но если зайти на сайт этой системы и попытаться найти там раздел технической документации, то можно обнаружить, что ссылка на эту документацию – не открывается: в DNS просто отсутствует адресная запись для домена, который заявлен в качестве адреса для документации. Так-то вот.
Комментарии (1) »
Попытались силами ChatGPT определить дату выпуска японской монеты периода Мэйдзи номиналом в 20 сенов. Загрузили в ChatGPT современной версии (пятой) фотографию именно той стороны монеты, на которой указана искомая дата (ну, такой эксперимент), направили “промпт” на русском языке. ChatGPT узнало монету в 20 сенов, рассказало, что годы таких японских монет обозначаются по периодам императорского правления (это верно), привело пример обозначения (!), а потом заявило, что нужно перевернуть монету и прислать фотографию другой стороны – типа, дата написана на другой стороне, а по имеющейся фотографии определить нельзя. Но на другой стороне написан номинал, а не дата. Дата как раз записана на той картинке, которую в ChatGPT и загрузили (специально).
Очередной типичный и практический пример, показывающий реальный уровень “полезности” данного инструмента и то, сколько там “интеллекта”. А ведь утверждают, что ИИ LLM нужно поручить анализ данных медицинской диагностики: рентгенограмм там, и других подобных данных. Но это одна из самых продвинутых LLM – и не может прочитать год выпуска старой японской монеты, хотя приводит верное описание того, как этот год записывается и интерпретируется.
Да, на таких японских монетах дата указывается по году периода, и записывается набором из нескольких иероглифических знаков. Если слева направо: обозначение “год”, потом номер самого года, потом – обозначение периода. Например (здесь группы знаков разделены точками, для наглядности): 年 . 七十三 . 治明. То есть, если теперь справа налево, то “Мэйдзи 37-й год”, или 1904 “европейский”. На аверсе монеты 1904 года в 20 сенов дата отчеканена справа от латинского обозначения номинала “20 sen” (см. фото ниже). Именно фотографию аверса и отправили для анализа. Присутствие латинских букв и арабских цифр могло бы помочь ChatGPT, если бы там был “интеллект”, но не помогло. На реверсе же монеты написан только номинал “20 сенов”, но японскими обозначениями: то есть, японские цифры там присутствуют, но это не год.

Аверс монеты – слева на коллаже. Именно эту фотографию и направили в ChatGPT (конечно, в большем разрешении).
Нетрудно предположить, как такой ответ ChatGPT получился: в интернетах на форумах часто пишут про монеты, что, мол, пришлите “фотографию лучшего качества”, “можно понять только по другой стороне” и т.д. Вот наборы таких фраз и склеились в ответ. При этом верное, в общем-то, описание – никак не повлияло на ошибочную формулировку. Потому что описание сконструировано не из смысла запроса, а исходя из набора “токенов” (слов и слогов) и их взаимного расположения. Это – программа. Генератор текстов.
Получается, что ChatGPT таким ответом даже успешно запутало бы незнакомого с предметом пользователя – ведь в предложении перевернуть монету есть логика: да, часто дата отчеканена на другой стороне, не на той, где написан номинал (пояснение: номинал здесь пользователь читает там, где он записан латиницей и арабскими цифрами).
А о том, что вышло бы из ChatGPT после загрузки фотографии реверса, мы в этой записке не узнаем: доступные токены закончились – видимо, картинки потребляют их особенно много.
Комментировать »
Опубликовал на “Хабре” небольшой текст про рекурсивное “центральное встраивание” (center embedding), которое доступно в английском языке, и его связь с восприятием языков и их грамматик. Речь про фразы вроде “The chap the cat the girl owned scratched screamed” – это как раз основной пример из статьи на “Хабре”. В разговорном языке, понятно, такое не встречается, но так-то у меня есть и вариант с вложенностью уровня пять (нетрудно строить по шаблону, конечно):
The ship the crocodile the chap the cat the girl owned scratched gnawed submerged resurfaced.
Годится для тестирования LLM/GPT.
The ship {
the crocodile {
the chap {
the cat {
the girl owned
} scratched
} gnawed
} submerged
} resurfaced.
Комментировать »
В продолжение предыдущей записки, про LLM и математические задачи. Google пока тоже не публикует технических подробностей о том, кто там и как перебирал и форматировал решения задач Международной математической олимпиады, чтобы получилась “золотая медаль”, однако, в отличие от OpenAI, в официальном новостном сообщении, есть, хотя бы, небольшие и довольно занятные намёки.
Во-первых, пишут, что использовалась некоторая “параллельная обработка” (parallel thinking) внутри модели, но, насколько можно понять, для подбора готовых решений. Цитата: “Эта конфигурация позволяет модели одновременно рассматривать и комбинировать многие возможные решения до выдачи окончательного ответа, вместо того, чтобы действовать по единственной, линейной цепочке рассуждений”. (This setup enables the model to simultaneously explore and combine multiple possible solutions before giving a final answer, rather than pursuing a single, linear chain of thought.)
Во-вторых, для получения решений провели “дополнительное обучение”, подстроенное для подходящих типов задач, и ввели инструкции, подобранные конкретно под задачи ММО (видимо, этого года – иначе нет смысла уточнять дважды). Цитата: “Мы также предоставили Gemini доступ к корпусу специально отобранных высококачественных решений математических задач и добавили в инструкции некоторые подсказки и советы общего характера о том, как решать задачи ММО”. (We also provided Gemini with access to a curated corpus of high-quality solutions to mathematics problems, and added some general hints and tips on how to approach IMO problems to its instructions.) Это самый интересный кусок из официального сообщения. Его можно понимать и так, что добавили базу с содержанием решений задач именно такого типа, как потом спрашивали, а позже ввели “советы” с ответами конкретных задач. А можно понять и так, что в процессе “настройки” корректировали входные данные, направляя вывод генерации к текстам верных доказательств (перечитайте в исходнике: a curated corpus of high-quality solutions).
Проще говоря, подробного описания процесса нет, а так – это уж слишком сильно напоминает улучшенный вариант традиционного уже упражения “ИИ сдаёт ЕГЭ” – выбираем тот сгенерированный текст из десятков выданных LLM вариантов, который набирает больше баллов.
Комментировать »
В продолжение предыдущей записки, про решение задач с Международной олимпиады средствами LLM: самое забавное, что, например, решение для первой задачи ММО-2025, которое сгенерировала “экспериментальная модель”, почему-то содержит ответ в самом начале – то есть, буквально, написано: смысл решения – доказать, что правильный ответ – правильный. Вот этот фрагмент, в виде скриншота (потому что там нужно “рендерить” LaTeX и Markdown):

Далее там идёт очень большой и не очень внятный сгенерированный текст доказательства, перегруженный отступлениями, понимать который довольно сложно, но не потому, что задача сложная, а потому, что много лишнего в “рассуждениях”. Сомневаюсь, что полезно делать его полный разбор. (Нет, сама исходная задача не требует таких больших объёмов для записи решения.)
Небольшое техническое пояснение: первая задача IMO 2025 это комбинаторная геометрия, нужно посчитать возможные варианты покрытия целых точек на решётке прямыми – это один из самых популяных “сеттингов” для олимпиадных задач; соответственно, набор возможных вариантов – {0, 1, 3} – появляется в процессе решения, поскольку составляет основную содержательную часть этого решения: надо понять, что других чисел (это количество подходящих прямых) там не может появиться; и то, что отсутствует 2, это, вообще говоря, не самый тривиальный момент (но и не самый сложный). Так что то, что решение от LLM OpenAI построено на доказательстве верности состава ответа, без указания на то, как этот состав получен, – почему, хотя бы, там не {1, 2, 3}, – выглядит весьма странно.
Комментировать »
Сообщают (осторожно, ссылка на Twitter), что некая “внутренняя”, экспериментальная модель от OpenAI продемонстрировала уровень “золотой медали” при решении задач Международной математической олимпиады (ММО) 2025 года. Подробностей, как обычно, нет, но опубликованы решения, которые сгенерировала та модель. Всё это занятно. Поделюсь ниже скриншотом по этой же теме, он из недавней выдачи “общедоступной” LLM той же корпорации – ChatGPT 4o.

“Нет, 205 не делится на 5” – считает данная LLM. Сам транскрипт относится к “обобщённой” задаче про набор воды вёдрами – там было три ведра огромного объёма и решать нужно было, понимая общие принципы обратимости/делимости. Откуда, собственно, и взялся НОД (gcd). Так что количество шагов и пр. – это более или менее близко к задаче, вот только использовать три ведра LLM не “догадалась”, без подсказки. Но это детали. Главное – это вывод про то, что “205 не делится на 5”.
Но, предположим, экспериментальная модель для ММО – существенно лучше, конечно. Хотя, и уровень золотой медали ММО, как бы, существенно выше.
Забавная история.
Комментарии (1) »
Повышение уровня абстракции – полезный и важный элемент процесса обдумывания, так как позволяет задействовать механизм “разрешения противоречий”. Если такой механизм есть, конечно.
Возьмём пару цитат и ещё одну, не менее замечательную:
“Нас невозможно сбить с пути, нам всё равно, куда идти”
М. М. Жванецкий(?), (есть вариант “никому не сбить”, не важно).
“У самурая нет цели – только Путь”
“Хагакурэ”, Ямамото Цунэтомо. (Иногда напоминаю коллегам эту важную максиму.)
Это почти об одном и том же. В первой цитате – всё равно, куда идти, но идти необходимо, иначе исчезает содержательная часть. Именно ход создаёт путь, который, по определению, тут не может вести к конкретной цели. Цели нет. Только Путь. Как и у самурая из второй цитаты. Почти.
“Всё равно куда” перекликается с одной из самых знаменитых цитат из “Алисы в Стране чудес”:
”
– Скажите, пожалуйста, куда мне отсюда идти?
– А куда ты хочешь попасть? – ответил Кот.
– Мне все равно… – сказала Алиса.
– Тогда все равно, куда и идти, – заметил Кот.
– …только бы попасть куда-нибудь, – пояснила Алиса.
– Куда-нибудь ты обязательно попадешь, – сказал Кот. – Нужно только достаточно долго идти.
“
Л. Кэрролл.
Эта цитата содержит машинерю, позволяющую детально разобрать две предыдущих цитаты. Всё равно, куда идти. Но если идти достаточно долго, то куда-нибудь попадёшь. Долгий ход, как сейчас говорят, “определяет”. Если недостаточно долго идти, то не получится дойти даже куда-нибудь (настолько размытое пространство). Как понять, что идёшь уже достаточно долго? Нужна точка отсчёта, иначе всякий раз может оказаться, что ход недостаточно долгий и никуда не приводит. Где предельный переход? Возможен ли он? У самурая нет этих проблем, из-за глубинных свойств его пути.

Занятно, что, согласно “Алисе в Стране чудес”, даже когда путь отделяется от цели, он обязательно приводит куда-нибудь. Это здесь чисто категорийное свойство пути – приводить куда-то. Стрелка.
К сожалению, такое определение недостаточно абстрактно: выходит, что если начать просто “идти” и “идти”, то это ещё не путь. В “невозможно сбить с пути”, не только путь появляется раньше цели, но и сказано, что куда-то мы должны идти. Да, всё равно – куда, но ведь – куда-то! Тем не менее, попытка отделить свойство, создающее путь, от цели, через “невозможность сбить с пути”, это абстракция достаточно высокого уровня, чтобы начать строить теорию категорий. Удивительно.

Тут-то и можно заметить преимущество положения самурая из самурайской цитаты, по сравнению с ситуацией “всё равно куда”. Во “всё равно куда” – цель неявно проступает, если попытаться задуматься и начать искать способ разрешения противоречий: как определить, что всё равно, куда? Ведь “куда” подразумевает некоторое направление пути, почти что цель. Для “куда” нужно ввести дополнительные понятия, чтобы отличать одно “куда” от “другого”. А про самурая нельзя сказать, что ему всё равно, куда идти. У самурая отсутствие цели постулируется, так что “куда” – просто не возникает. Все “куда” поднимаются для самурая в Путь (см. иллюстрацию).
Дзен самурая – дзен более высокого уровня, на фоне которого “всё равно куда” выглядит некоторым мельтешением: суетятся, бегают куда-то, всё равно, куда – лишь бы бегать. Самурай не суетится. У самурая нет цели. Только путь.
Комментарии (1) »
Новый