Destaque

publicação mais vista
🔥 Mais popular
A
AdGuard [RU]
@adguardru
5.6K

🫥 Вы не залогинились, не оставили почту, включили «инкогнито» — а сайт всё равно вас узнаёт. Как?

Дело в фингерпринтинге — цифровом отпечатке. Пока вы просто открываете страницу, браузер услужливо сообщает десятки мелочей: модель устройства, версия ОС, язык, разрешение экрана, установленные шрифты, часовой пояс, как именно ваша видеокарта рисует графику. Это не работает по отдельности, но вместе превращается в комбинацию, которая часто уникальна, как отпечаток пальца.

И вот что коварно: куки можно удалить, а отпечаток остаётся. «Инкогнито» прячет историю от других людей за вашим устройством, но не мешает сайтам собирать данные. Именно поэтому реклама иногда «догоняет» вас там, где вы, кажется, ничего о себе не оставляли.

Полностью стать невидимым не выйдет, и обещать обратное было бы нечестно. Но отпечаток можно сделать менее уникальным:

🌟Блокируйте трекеры и скрипты сбора данных — меньше тех, кто вообще снимает отпечаток 🌟Срезайте метки в ссылках и чистите сторонние cookie, чтобы было труднее создать ваш единый профиль 🌟Скрывайте часть параметров, которые сайт видит по умолчанию — этим занимается Tracking protection в AdGuard

Знать, как вас узнают, — первый шаг к тому, чтобы раскрывать о себе только необходимое.

Mais de outros canais

149 publicações no total
P
pc_construct
@pc_construct
2.1K

🌸 Собрали для клиента красивый белый ПК и распечатали на карту накладку. Как вам?

Конфигурация: • Пpoцессoр — AMD Ryzen 7 9800X3D • Видеокарта — Palit GeForce RTX 5080 GamingPro • Матеpинcкая плaтa — MSI B850 GAMING PLUS WIFI6E • Опеpaтивная пaмять — 32Гб G.Skill Trident Z5 RGB 2x16Гб 6000МГц • Охлаждение — HydroShift II LCD-S 360N White • Накопитель — 2000 ГБ M.2 NVMe ADATA LEGEND 960 MAX • Блок питания — PHANTEKS AMP GH, 1000W • Корпус — LIAN LI O11 Vision COMPACT

На все сборки предоставляется гарантия. Варианты сборок можно найти в каталоге или на сайте. По любым вопросам пишите нам — всегда на связи

G
growthresearch
@growthresearch
675

💻 아마존 AWS, AI 수요가 GPU 넘어 CPU까지 압박, EC2 서버 용량 부족 현실화

https://www.theinformation.com/articles/aws-tells-engineers-cut-cpu-waste-amid-crunch

📌 GPU만이 아니다…CPU 서버까지 공급 부족 AWS는 향후 EC2 고객 수요 대응을 위해 엔지니어들에게 CPU·AI 서버 전반의 컴퓨팅 용량 절감을 지시

기존에는 수시간이면 확보하던 CPU 서버 용량이 최근에는 수일씩 걸리는 사례 발생

AI 인프라 병목이 GPU에서 범용 CPU와 데이터센터 전체 컴퓨팅 자원으로 확산되는 흐름

📌 AWS 내부에서도 ‘며칠 대기’ 등장 일부 AWS 엔지니어는 수년간 근무하면서 이 정도로 CPU 서버 확보가 지연된 적이 없었다고 언급

서버 용량 확보 지연으로 내부 프로젝트 일정까지 영향을 받을 수 있는 상황

AI 칩뿐 아니라 CPU 기반 EC2 인스턴스까지 수급이 타이트해졌다는 점이 핵심

📌 유휴 EC2까지 회수…용량 확보 총력전 AWS는 올해 안으로 각 팀의 컴퓨팅 사용량을 줄이기 위한 목표와 기한을 설정

개발 과정에서 생성했지만 현재 사용하지 않는 EC2 인스턴스를 종료해 고객용 용량으로 재배치

신규 증설만으로 대응하기보다 기존 인프라 효율화까지 병행해야 할 정도로 공급 부담 확대

📌 AI 투자 사이클, 서버·CPU·메모리까지 확산 생성형 AI 확대로 GPU뿐 아니라 CPU 서버 수요도 동반 증가하며 데이터센터 병목 범위가 확대

AWS의 용량 절감 조치는 AI 인프라 투자가 가속기 단품이 아닌 서버 시스템 전체의 증설을 요구하고 있음을 시사

서버 CPU·DRAM·SSD·네트워크 등 데이터센터 밸류체인 전반의 수요 강도를 재확인할 수 있는 신호

💻반도체 소부장💻[그로쓰리서치] https://telegram.me/growth_semi

S
sammyfans
@sammyfans
1.1K

NVIDIA is reportedly weighing a significant reduction in the HBM capacity of its upcoming Rubin Ultra GPU, and the numbers being tested are far below what was originally announced.

https://www.sammyfans.com/2026/08/07/nvidia-may-cut-rubin-ultra-hbm-capacity-amid-memory-shortage/

I
IT Работа: Сербия и удаленка Lenkep 🔥
@youritjob
1.7K

Дайджест вакансий за рабочую неделю: 3 августа — 7 августа

Поздравляем с выходными! Давайте просмотрим, какие топовые вакансии были на этой неделе!

Прежде чем переходить к вакансиям:

1. Почитайте, как правильно составить резюме. 2. Почитайте, как правильно отвечать на вопросы во время собеседования.

Developer/Engineer 😊

» Senior Unity Developer в Dev Cynx » GPU Software Engineer (Graphics / ML) в Luxoft » Regular BI Developer в Luxoft » Senior Quality Assurance Engineer в Luxoft

Work in Serbia 🤯

» Executive Assistant для CEO в LENKEP⚡ » Senior Backend Developer в Spinsoft Gaming » QA Test Engineer в Uvation » Team Lead Analyst (CRM Vertical) » Data Engineer

Other (remote) 👨‍💻

» Sales Manager в LENKEP⚡ » UI/UX Artist в Moonmana » Business Development Manager » Publishing Operations Associate в Hypercell Games » Web-аналитик в ElsiKora

P. S. Если вы хотите разместить вакансию, найти сотрудника или оставить резюме, обратитесь в наше HR-агентство Lenkep. Все контакты есть в этом посте.

G
growthresearch
@growthresearch
3.1K

💻빅테크의 AI 투자, 연간 1조 달러 시대 진입 [Goldman Sachs]

📌 대상 기업 Alphabet, Microsoft, Meta, Amazon

Oracle, Baidu, Tencent, Alibaba

글로벌 주요 하이퍼스케일러 8개사 기준

📌 투자 규모 추이 2010~2020년: Capex 및 R&D 투자의 완만한 증가

2021년 이후: 클라우드 및 AI 인프라 투자 확대에 따른 증가세 가속

2024년 이후: 투자 규모의 본격적인 급증 구간 진입

📌 Goldman Sachs 전망 2026E: Capex + R&D 합산 투자액 연간 1조 달러 돌파 전망

2026~2029E: 투자 증가세의 지속적인 가속 예상

2029E: 연간 투자액 2조 달러 수준까지 확대 전망

📌 투자 확대의 핵심 배경 생성형 AI 경쟁 심화

AI 데이터센터 구축 확대

GPU 및 AI 가속기 투자 증가

클라우드 컴퓨팅 인프라 증설

전력·네트워크·냉각 등 데이터센터 관련 인프라 투자 확대

📌 시사점 생성형 AI 경쟁의 본질이 모델 경쟁에서 대규모 자본투자 경쟁으로 확장

빅테크 AI Capex의 단기 테마가 아닌 중장기 구조적 투자 사이클 진입 가능성

GPU → 서버 → 네트워크 → 전력 → 냉각 → 데이터센터로 이어지는 AI 인프라 밸류체인 전반의 수혜 가능성

향후 핵심 관전 포인트는 Capex의 실제 수혜처와 투자 대비 AI 수익화 속도

💻반도체 소부장💻[그로쓰리서치] https://telegram.me/growth_semi

K
Kaggle Data Hub
@datasets1
241

🗂️ D A T A U N L O C K E D ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸

📌 Chinese MNIST ✏️ Chinese numbers handwritten characters images

▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸

📦 Size › 16.5 MB 👍 Votes › 276 ⬇️ Downloads › 13.7K 📅 Updated › Mar 28, 2021 ⚖️ License › CC0: Public Domain

🔖 #classification #deeplearning #image #multiclassclassification #gpu

▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ ▸ 📡 Channel: @DATASETS1

P
python4all_pro
@python4all_pro
414

📕 کتاب«GenAI با پایتون و PyTorch» — چاپ دوم، مارس ۲۰۲۵

👨🏻‍💻 اگه از کتابایی خسته شدی که فقط تئوری می‌گن و آخرش نمی‌دونی چطوری کد بزنی، وقتشه با این کتاب آشنا بشی.

📚 چاپ دوم این کتاب (مارس ۲۰۲۵) یه بازنویسی کامله: از TensorFlow به PyTorch مهاجرت کرده، مدل‌های LLM و Diffusion رو هم اضافه کرده و کل چرخه‌ی آموزش رو پوشش میده.

🧠 توش چی پیدا میشه؟

🔸 فصل ۱–۲: پایه‌ها ؛GenAI چیه و چطوری با Midjourney، DALL-E و ChatGPT زندگی‌مون رو عوض کرده 🔸 فصل ۳–۵: NLP و Transforme 🔸 فصل ۶–۷: Open-Source LLM و Prompt Engineering 🔸 فصل ۸–۱۰: Multimodal 🔸 فصل ۱۱–۱۲: VAE و GAN 🔸 فصل ۱۳–۱۴: Style Transfer و Deepfakes

چرا این کتاب خاصه؟

✅ انتقال از تئوری به کد در یه فصل — فرمول ریاضی می‌بینی، بعد بلافاصله PyTorch پیاده‌سازیش می‌کنی ✅ پروژه‌های واقعی — ترجمه، نقد فیلم، Deepfake، Style Transfer ✅ ۴۵۴ صفحه پر از تمرین و کد عملی ✅ استفاده از Google Colab — نیازی به GPU گرون نداری ✅ ترکیب PyTorch + جامعه‌ی اوپن‌سورس — همه‌چیز قابل اجراست

گیت هاب

🆔 @python4all_pro

🧩لینک کانال در بله 👇👇 https://ble.ir/Python4all_pro

М
Мужской AliExpress
@mensalik
915

Ноутбук Honor MagicBook Pro 16 по самой низкой цене среди всех маркетплейcов. По начинке мы получаем видеокарту Nvidia RTX5060, 32 гб оперативной памяти, процессор Intel core Ultra 5, 3K дисплей на 165 герц и ssd диск на 1 тб

на аliеxрrеss - https://ali.click/53coi1n?erid=2SDnjemKjR5

D
Devops Jobs — вакансии и резюме
@devops_jobs_feed
1.6K

Публикатор: Yar Обсуждение: @devops_jobs #резюме #devops #sre #monitoring #remote #kubernetes

Позиция: DevOps / SRE / Monitoring Engineer / System engineer Формат работы: Удалённый Занятость: Полная Ожидания по зарплате: 2500-3500$ Локация: Грузия / Москва (открыт к full-remote проектам и предложениям с релокацией)

В ИТ более 3 лет, специализируюсь на автоматизации инфраструктуры, отказоустойчивых корпоративных сервисах и системах мониторинга и оповещения. Архитектура и IaC: Развивал и поддерживал гибридную инфраструктуру (on-premise Proxmox + облако Beget). Описывал инфраструктуру как код в Terraform, автоматизировал развёртывание, обновление и настройку стека через Ansible-плейбуки. Обновлял и сопровождал кластеры Kubernetes. CI/CD и Автоматизация: Выстраивал и развивал процессы непрерывной интеграции и CI/CD-шаблоны в Azure DevOps. Контейнеризировал сервисы в Docker, писал скрипты автоматизации на Bash и Python. Мониторинг и Логирование: Проектировал и внедрял системы мониторинга и алертинга на базе Grafana, VictoriaMetrics, Prometheus, Zabbix и Alertmanager. Настраивал кастомные экспортеры метрик. Внедрил ELK для централизованного сбора логов и ускорения траблшутинга. Сервисы и интеграции: Поддерживал и настраивал Kafka, RabbitMQ, Vault, Keycloak, Temporal, Airflow. Интегрировал новые сервисы - GPU-платформу, Vault, настройку CDN. Системное администрирование: Обеспечивал стабильную работу корпоративных сервисов - настройка, интеграция, резервное копирование, миграция, контейнеризация. Настраивал серверы виртуализации и веб-серверы, администрировал стек 1С.

Английский: A2

Технический стек: Kubernetes, Terraform, Ansible, Docker, Azure DevOps CI/CD, Proxmox, Grafana, VictoriaMetrics, Prometheus, Zabbix, Alertmanager, ELK, Kafka, RabbitMQ, Vault, Keycloak, Temporal, Airflow, CDN, PostgreSQL, MSSQL, Python, Bash, 1C, GLPI.

tg: @yar_white

U
UzDev Jobs – IT Jobs
@uzdev_jobs
3.8K

#ai #ml #middle AI Engineer Company: Zehnmind.ai Location: Tashkent (Office-based) Salary: $2,000+ USD (depending on skills and experience) We are looking for an AI Engineer to design, build, and deploy machine learning models and data pipelines. You will work across the full ML lifecycle — from data preparation and model training to deployment and monitoring.

Key Responsibilities: Model Development: Develop and optimize models across LLMs, NLP, CV, or related AI domains. Data Engineering: Design and architect data mining and synthetic labeling pipelines. Data Processing: Preprocess data, perform feature engineering, and work with large-scale datasets. Training & Evaluation: Train and evaluate models using PyTorch or TensorFlow. MLOps: Deploy and monitor models using MLOps tools and cloud infrastructure. Containerization: Use Docker and container toolkits to train models in containerized environments. Collaboration: Partner with backend and product teams to integrate AI capabilities into production. Code Quality: Maintain version-controlled, well-documented codebases.

Requirements: Experience: 2+ years of commercial experience & 4+ years of total experience in ML/AI engineering. Language: Strong proficiency in Python and English. Frameworks: Deep understanding of PyTorch or TensorFlow. ML Fundamentals: Solid grasp of supervised/unsupervised learning, deep learning, optimization, and metrics. MLOps Tools: Experience with MLflow, Kubeflow, or SageMaker. Cloud & DevOps: Familiarity with cloud platforms (AWS Lambda or similar) and Docker for training. Git: Strong version control and collaborative development practices.

Good to Have: Experience with vector databases (Qdrant, Weaviate, Pinecone). Knowledge of model quantization, distillation, or fine-tuning techniques. Familiarity with Kubernetes for model serving at scale. Experience building synthetic data or annotation pipelines.

We Offer: Competitive salary starting from $2,000+ USD. Company-sponsored lunch. Comfortable office in Tashkent. Clear career growth while building a large-scale product.

How to Apply: Submit your application to [email protected] or [email protected] Please include: Your CV/Resume. GitHub profile or Portfolio. A 2–3 paragraph description of your AI workflow.

👉 Подписаться на канал @UzDev_Jobs

D
Dev KZ | Vacancy
@devkz_jobs
3.5K

#астана #python

🚀 Middle / Senior Computer Vision Engineer

Работа над AI-продуктами с применением компьютерного зрения и видеоаналитики. Полный цикл разработки: от исследования и обучения моделей до их внедрения в production.

⚙️ Что предстоит делать • Проектировать и развивать CV / Video Analytics модели (детекция, трекинг, распознавание лиц, анализ поведения); • Интегрировать ML-модели в production (backend, edge); • Обучать и дообучать модели (fine-tuning, transfer learning); • Работать над реальными AI-проектами с бизнес-применением; • Сопровождать полный цикл разработки: от исследования до деплоя; • Оптимизировать модели и повышать качество CV-решений.

Важно: ✔️ уверенные знания Computer Vision и современных DL-подходов; ✔️ глубокое понимание машинного обучения и нейронных сетей (CNN, detection/segmentation); ✔️ уверенное владение Python; ✔️ опыт работы с OpenCV, NumPy, PyTorch и/или TensorFlow; ✔️ опыт работы с Git; ✔️ опыт оптимизации моделей (speed/accuracy trade-offs, inference); ✔️ опыт решения задач детекции, трекинга и анализа поведения людей.

💼 Формат: офис, Астана.

📩 Если вам интересно развивать AI-решения и работать над проектами в области Computer Vision — отправьте сразу резюме в Telegram: @waitingfor1

I
InterNews - Новости про ПК и гаджеты
@internews_hw
323

⚡️ Утилита защитит разъём питания RTX 5090 аварийным отключением ПК

Энтузиаст выпустил бесплатную 12VHPWR Guard, которая отслеживает ток на каждом силовом контакте разъёма 12V-2x6. Если нагрузка на одном из них превышает 9,5 А дольше 15 секунд, программа принудительно выключает компьютер, чтобы снизить риск перегрева и оплавления.

Утилита работает только с поддерживаемыми ASUS ROG Astral RTX 5080 и RTX 5090, оснащёнными отдельными датчиками тока. Порог и задержку можно менять, а данные считываются напрямую с видеокарты или через HWiNFO.

12VHPWR Guard доступна бесплатно для Windows 10 и 11. Разработчик предупреждает, что программа не гарантирует полную защиту и не заменяет правильное подключение кабеля.

#ПO

P
programming_experts
@programming_experts
6

If you want to get a job as a machine learning engineer, don’t start by diving into the hottest libraries like PyTorch,TensorFlow, Langchain, etc.

Yes, you might hear a lot about them or some other trending technology of the year...but guess what!

Technologies evolve rapidly, especially in the age of AI, but core concepts are always seen as more valuable than expertise in any particular tool. Stop trying to perform a brain surgery without knowing anything about human anatomy.

Instead, here are basic skills that will get you further than mastering any framework:

𝐌𝐚𝐭𝐡𝐞𝐦𝐚𝐭𝐢𝐜𝐬 𝐚𝐧𝐝 𝐒𝐭𝐚𝐭𝐢𝐬𝐭𝐢𝐜𝐬 - My first exposure to probability and statistics was in college, and it felt abstract at the time, but these concepts are the backbone of ML.

You can start here: Khan Academy Statistics and Probability - https://www.khanacademy.org/math/statistics-probability

𝐋𝐢𝐧𝐞𝐚𝐫 𝐀𝐥𝐠𝐞𝐛𝐫𝐚 𝐚𝐧𝐝 𝐂𝐚𝐥𝐜𝐮𝐥𝐮𝐬 - Concepts like matrices, vectors, eigenvalues, and derivatives are fundamental to understanding how ml algorithms work. These are used in everything from simple regression to deep learning.

𝐏𝐫𝐨𝐠𝐫𝐚𝐦𝐦𝐢𝐧𝐠 - Should you learn Python, Rust, R, Julia, JavaScript, etc.? The best advice is to pick the language that is most frequently used for the type of work you want to do. I started with Python due to its simplicity and extensive library support, and it remains my go-to language for machine learning tasks.

You can start here: Automate the Boring Stuff with Python - https://automatetheboringstuff.com/

𝐀𝐥𝐠𝐨𝐫𝐢𝐭𝐡𝐦 𝐔𝐧𝐝𝐞𝐫𝐬𝐭𝐚𝐧𝐝𝐢𝐧𝐠 - Understand the fundamental algorithms before jumping to deep learning. This includes linear regression, decision trees, SVMs, and clustering algorithms.

𝐃𝐞𝐩𝐥𝐨𝐲𝐦𝐞𝐧𝐭 𝐚𝐧𝐝 𝐏𝐫𝐨𝐝𝐮𝐜𝐭𝐢𝐨𝐧: Knowing how to take a model from development to production is invaluable. This includes understanding APIs, model optimization, and monitoring. Tools like Docker and Flask are often used in this process.

𝐂𝐥𝐨𝐮𝐝 𝐂𝐨𝐦𝐩𝐮𝐭𝐢𝐧𝐠 𝐚𝐧𝐝 𝐁𝐢𝐠 𝐃𝐚𝐭𝐚: Familiarity with cloud platforms (AWS, Google Cloud, Azure) and big data tools (Spark) is increasingly important as datasets grow larger. These skills help you manage and process large-scale data efficiently.

You can start here: Google Cloud Machine Learning - https://cloud.google.com/learn/training/machinelearning-ai

I love frameworks and libraries, and they can make anyone's job easier.

But the more solid your foundation, the easier it will be to pick up any new technologies and actually validate whether they solve your problems.

USEFUL RESOURCES TO LEARN MACHINE LEARNING 👇👇

Intro to ML by MIT Free Course

https://openlearninglibrary.mit.edu/courses/course-v1:MITx+6.036+1T2019/about

Machine Learning for Everyone FREE BOOK

https://buildmedia.readthedocs.org/media/pdf/pymbook/latest/pymbook.pdf

ML Crash Course by Google

https://developers.google.com/machine-learning/crash-course

Advanced Machine Learning with Python Github

https://github.com/PacktPublishing/Advanced-Machine-Learning-with-Python

Practical Machine Learning Tools and Techniques Free Book

https://vk.com/doc10903696_437487078?hash=674d2f82c486ac525b&dl=ed6dd98cd9d60a642b

Python Machine Learning for beginners

https://t.me/datasciencefun/1177?single https://topmate.io/coding/914624

All the best 👍👍

G
gonzo-обзоры ML статей
@gonzo_ml
2.4K

Статья раздевает рекурсивный трансформер до голых костей, обнаруживает, что он больше не может ходить, и торжественно заявляет об открытии универсальной необходимости костылей. Фикс инициализации ACT — это потрясающая инженерная заметка, похороненная внутри работы, которая дико переоценивает свою архитектурную значимость.

Оценка: 4/10. Отличный пулл-реквест на GitHub, маскирующийся под фундаментальный закон вычислений.

=======

Имхо получилось хорошо. Замечания по делу, работа могла бы быть лучше, если бы автор находился в GPU-rich режиме и прогнал на порядок больше экспериментов :) Ну может когда-нибудь и прогоню. И сделаю версию сопоставимую по флопсам с TRM/URM, а то конечно сравнение с TRM просится. Упирая на те 6% на тесте, прожарка оставляет за скобками, что на более богатом данными сетапе это уже не меморизация, а обобщение на вполне достойные ~60%. Претензия про ободранную как липка архитектуру принимается, но с другой стороны этот минимализм и был целью. В целом всё по делу, выдуманных фактов ноль.

Более мягкая версия среди положительных результатов зацепилась за анализ паттернов внимания, эта и более тяжёлая — за улучшение глубокого старта. Прикольно, что прожарка нашла параллельную работу про аналогичное улучшение глубокого старта, я её не видел.

Если формат зайдёт — буду иногда прожаривать избранные статьи. Кидайте кандидатов в комментарии.

G
gonzo-обзоры ML статей
@gonzo_ml
2.1K

Прожарка 🔥

Экспериментирую с форматами обзоров. Добавил в свою систему режим Paper Roast — рецензия, которую никто не решается написать. Всё то, что обычно бормочут у постера, но не пишут в ревью: бейзлайн, выбранный потому что остальные не завелись; абляция, отсутствующая ровно там, где было бы больно; заявление из абстракта, которое эксперименты так и не проверяют.

Три уровня: 🔥 Medium, 🌶 Spicy, ☢️ Nuclear. Система по ходу чтения ищет в вебе, так что «это уже сделали в 2019-м, а они не цитируют» — это пруф, а не ощущение. И два железных правила: критика только работы, никогда авторов, и каждый удар должен указывать на конкретное место в статье.

Экспериментирую на себе: прогнал собственную статью про универсальный трансформер с памятью (https://t.me/gonzo_ML/5270) в режиме Spicy. Наслаждайтесь.

=======

Как сломать трансформер и выдать костыли за революцию

Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning Grigory Sapunov Статья: https://arxiv.org/abs/2604.21999 Код: https://github.com/che-shr-cat/utm-jax Ревью: https://arxiviq.substack.com/p/universal-transformers-need-memory Пост про подход: https://gonzoml.substack.com/p/why-i-keep-coming-back-to-universal

# TL;DR

ЧТО сделали: Взяли рекурсивный трансформер, отрезали от него всё лишнее, заставили решать судоку через механизм Adaptive Computation Time (ACT) и заявили, что для комбинаторных задач таким моделям фундаментально необходима внешняя память (scratchpad). Заодно "починили" старый баг с инициализацией ACT.

ПОЧЕМУ это важно: Статья служит блестящим примером того, как не надо делать науку. Она наглядно показывает, как можно выдать тривиальный оверфит на трех сидах за архитектурный прорыв. Однако, несмотря на весь пафос, внутри действительно спрятан полезный инженерный фикс, который убережет тех, кто обучает рекурсивные сети, от потери месяцев GPU-часов.

Для практиков: Если вы используете ACT, забудьте совет Грейвса из 2016 года об инициализации смещения (bias) роутера значением +1. Инициализируйте его отрицательным значением (например, -3), иначе ваша модель намертво застрянет в состоянии "неглубокой остановки" на самых ранних этапах обучения.

# Жареное Мясо 🥩

🎪 Претензия на величие

Статья претендует на срыв покровов и открытие фундаментальной архитектурной истины: рекурсивным "Универсальным Трансформерам" якобы жизненно необходим выделенный скретчпад в памяти, чтобы щелкать комбинаторные задачи на рассуждение типа судоку. Устранив так называемую "ловушку инициализации роутера" в Adaptive Computation Time (ACT), авторы обещают раскрыть истинную мощь рекурсивного компромисса между глубиной и состоянием, прокладывая путь к эффективным динамическим вычислениям на инференсе.

🤡 "Универсальное" правило, на которое всем плевать

Заголовок кричит: "UNIVERSAL TRANSFORMERS NEED MEMORY". И тем не менее, в тексте авторы тихо признаются, что конкурирующие рекурсивные архитектуры (TRM, HRM) решают ту же самую задачу с судоку без всяких токенов памяти. Чуть позже выясняется, что архитектура URM тоже прекрасно справляется без явного персистентного состояния. Как они это оправдывают? "Необходимость специфична именно для нашей архитектуры UT с одним блоком". Это полностью обесценивает и заголовок, и центральную идею работы. Токены памяти не являются фундаментально необходимыми для рекурсивных вычислений; они нужны лишь для того, чтобы залатать ту конкретную, ободранную как липка архитектуру, которую авторы с упорством маньяка продолжают использовать. Это как вырвать из машины руль и выпустить статью с заявлением, что всем транспортным средствам фундаментально необходим штурвал.

📉 Катастрофа с обобщением

На этапе оценки обобщающей способности работа перестает быть статьей про задачи на рассуждение и превращается в упражнение по архивации баз данных. Обучившись на крошечном датасете из 1000 головоломок, модель выбивает 99.6% Train EM и жалкие 6.0% Eval EM на невиданных данных. Для сравнения, бейзлайн TRM в точно таком же режиме достигает 87.4% обобщающей способности. Текст отмахивается от этого факта, предполагая, что механизм TRM "возможно, лучше подходит для алгоритмического обобщения".

Точность в 6% на новых данных — это не "смешанное алгоритмическое обобщение", это тотальный провал в выучивании алгоритма. Модель на 3.2M параметров тупо зазубрила трейн, а значит, все эти "специализированные паттерны внимания" — не более чем оверфитнутые lookup-таблицы.

💸 ACT как дорогой костыль от дисперсии

Статья пиарит ACT как сложный механизм подмены глубины на состояние. Но если посмотреть на сами метрики: модель без ACT (с отключенной фиксированной глубиной, 18 шагов) набирает 63.4% EM на сиде 123. Абсолютно лучшая конфигурация ACT в тех же условиях выдает лишь 58.0% EM.

ACT не пробивает потолок качества; на самом деле он его занижает по сравнению с лучшим прогоном фиксированной глубины. Поскольку ACT вычисляет взвешенную смесь репрезентаций по всем K шагам, он работает просто как ансамбль для усреднения чудовищной зависимости от сида (± 9.3%), которой от природы страдает эта спартанская архитектура. Это тупо функция сглаживания, маскирующаяся под динамический ризонинг.

🎲 Закон малых чисел

Все грандиозные заявления о дисперсии, стабильности и "резких порогах" опираются ровно на три сида (S=0, 42, 123). Дисперсия в ± 9.3% при выборке из трех запусков означает, что буквально один прогон получился хорошим (63.4%), один — плохим (44.9%), и один оказался где-то посередине (52.0%). Делать далеко идущие, авторитетные выводы о "надежности" ACT по сравнению с фиксированной глубиной на выборке из трех элементов — это статистическая халатность.

🍄 Галлюцинация "границы размытия"

Авторы заявляют о некой "границе размытия при T=64", где качество падает на целых 2 процентных пункта. Насколько надежен этот вывод? В тексте прямо говорится: "Имея только один сид в этом свипе, мы не можем исключить, что разрыв в 2 п.п. — это просто шум одного сида".

То есть исследователи открытым текстом признают, что им не хватает статистической мощности, чтобы доказать, что это падение не является белым шумом, но тут же на голубом глазу начинают обращаться с этим как с "архитектурным свойством на больших T". Нельзя объявлять фундаментальный закон размытия внимания на основе падения в 2 пункта на единственном прогоне N=1, особенно когда ваш бейзлайн штормит на 18 пунктов между разными сидами.

🧾 Что по фактам

Обнаружение "ловушки инициализации роутера" (установка bias в ACT на -3 вместо рекомендованного Грейвсом +1) преподносится как спасательная операция для всей архитектуры. Это решение прямо противоречит рекомендации Грейвса (2016) начинать с положительного смещения, чтобы "предотвратить очень длинные последовательности", справедливо указывая на то, что задачи на рассуждение требуют глубоких траекторий на ранних этапах. Это действительно чистое расхождение с фундаментальной литературой по ACT.

Правда, называть это невероятным откровением для 2026 года — немного притянуто за уши; параллельные работы по глубоким рекуррентным сетям, такие как Thinking Deeper, Not Longer (2026), уже используют отрицательную инициализацию смещения (-2.0) для вентильных рекурренсий, чтобы форсировать глубокую раннюю обработку и избежать shortcut learning. Тем не менее, формальное диагностирование этого эффекта и его абляция как ловушки градиентного голодания, специфичной для ACT, — это валидный и хорошо задокументированный вклад.

🤝 Неохотный респект

Абляции "глубокого старта" при инициализации ACT — это реально топ. Демонстрация того, что стандартная инициализация Грейвса математически загоняет модели в состояние неглубокой остановки (p ≈ 0.5 -> остановка за 2 шага) — это четкий, применимый на практике результат. Модификация цикла ACT для логирования градиентов роутера и доказательства этого фейлур-мода — это ровно тот самый суровый, черновой дебаггинг, который экономит другим исследователям месяцы сожженных вычислений.

🏁 Итоги

И
Инжиниринг Данных
@rockyourdata
3.2K

Интересная локальная модель Gemma4-12B-Coder для Python, работает без интернета. Нужно 4.5 Gb VRAM.

Если вдруг вопрос про RAM vs VRAM: RAM — рабочий стол обычного офисного работника (CPU) VRAM — рабочий стол дизайнера с огромным монитором (GPU)

Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет

I
InterNews - Новости про ПК и гаджеты
@internews_hw
850

🛫 ASUS отказалась продавать RTX 5090 по старой цене после оплаты заказа

Пользователь заказал ASUS ROG Astral RTX 5090 BTF через официальный магазин NVIDIA за $4429 без налогов - итоговая сумма составила $4607. Позже заказ отменили, деньги полностью вернули, а цена той же видеокарты выросла до $4982 без налогов, или примерно $5100 с учётом сборов.

Служба поддержки NVIDIA заявила, что ASUS передала обновлённую цену уже после оформления покупки и отказалась выполнить заказ по прежней стоимости. NVIDIA просила сохранить первоначальные условия, но восстановить отменённый заказ или оформить новый по старой цене не смогла. ASUS, в свою очередь, направила покупателя обратно к NVIDIA. Подорожание составило $553 без налогов, или 12,5%.

#Аsus

K
ktroom
@ktroom
3.6K

💼 HP EliteBook 1040 G8 — преміальний металевий ультрабук у ідеальному стані. Сенсорний FHD екран, i7 11-gen, 16GB RAM — швидкий, легкий та дуже комфортний у роботі 🔥

Гарантія 6 місяців 🏦🏦🏦 оплата частинами

Характеристики: 🟦Windows 11 ⚙️Діагональ: 14.1 FHD TOUCH ⚙️Процесор: Intel Core i7 1185G7 ⚙️Оперативна пам’ять: 16gb LPDDR4 4267Mhz ⚙️Відеокарта: Intel Graphics ⚙️Накопичувач: SSD 256gb 🔋Акумулятори: до 4 годин роботи Код 12104

💳Ціна 20500грн💸

Телефон 📲+380975202515 🌐KTROOM.COM.UA / НАПИСАТИ

«
«Палач» | Скидки, акции, промокоды
@govnali
1.1K

Игровой ноутбук MSI внезапно обесценился. Вариант со 144-герцовым экраном и видеокартой RTX 3050

Возможность, которой надо пользоваться:

https://click-or-die.ru/2026/08/igrovoj-noutbuk-msi-vnezapno-obesczenilsya-variant-so-144-gerczovym-ekranom-i-videokartoj-rtx-3050/

E
egorkmrapple
@egorkmrapple
1.3K

Такие характеристики обычно стоят дороже. Но не сегодня. MacBook Air 15 - 139.990💸🔥

🔝Покупайте тот, которым будете пользоваться с удовольствием каждый день🔝

💻MacBook Air 15 2024 M3 24 GB/2TB [8C CPU|10C GPU] Midnight - 139.990💸💥

💻MacBook Air 15 2024 M3 24 GB/2TB [8C CPU|10C GPU] Silver - 139.990💸💥

💻MacBook Air 15 2024 M3 24 GB/2TB [8C CPU|10C GPU] Starlight - 139.990💸💥

*⃣Действует выгодная рассрочка на срок от 12 до 24 месяцев *⃣Гарантия 1 год на всю технику✅ *⃣Доставка по СПб день в день, по РФ от 1 до 3-х дней (среднее значение)

📍Спасский переулок 14/35, Бц "На Сенной", второй этаж, 214 офис

Для заказа пишите: @egorkmrv

💬 Мы в tg 💙 Мы в VK 🎁 EKBonus.com

T
TECHNOZON
@technozonofficial
2.1K

😮 Распродажа ☀️SUMMER CLEARANCE ☀️! Лови скидки до 60%!

✨ТВ бокс Rocktek GX1✨ - идеальный выбор! Обзор - https://youtu.be/eiQ5YFjgLY8

⚙️Некоторые его характеристики: ✔️Процессор Realtek RTD1325 поддерживает технологии AIPQ и AISR. ✔️AIPQ использует искусственный интеллект для оптимизации качества изображения, улучшая контрастность, четкость и цветопередачу. ✔️AISR анализирует изображение и повышает его чёткость при масштабировании в реальном времени с помощью искусственного интеллекта. ✔️Видеокарта Mali-G57 с высокой производительностью обеспечивает плавное воспроизведение контента в 4K.

➡️ Купить RockTek GX1: Aliexpress - https://s.click.aliexpress.com/e/_EJDrI6w ПРОМОКОД для скидки 9$ - IFP3UVBS

➡️ А в Украине RockTek GX1 с официальной гарантией - https://tinyurl.com/57pfhu7y Промокод для скидки 5% - TECHNOZON

✏️Rocktek GX1 — это максимум качества: крутая картинка, объёмный звук и официальная поддержка Netflix.🙂

✔️Таможенный калькулятор для покупок с AliExpress С ЭКОНОМИЕЙ - https://podatok.online

T
TRASHBOX.RU
@trashbox_feed
1.4K

🎮 Слух: NVIDIA работает над технологией, которая позволит будущим видеокартам использовать SSD в роли дополнительной видеопамяти

Суть технологии в том, что когда видеокарта исчерпает объём доступной VRAM, она сможет задействовать NVMe SSD в качестве подстраховки. Правда, даже самый быстрый SSD уступает по скорости видеопамяти современных видеокарт, но, теоретически, это позволит повысить производительность в играх