ИТ наизнанку. Посторонним В!

Ну перцу задала на рынке :fire: бест не бест, но эффективная

1 лайк

А у тебя нет проблем с отвалами гпт в почтение э последние дни? Там у них у самих регулярно ошибки:


Но у меня такое чувство, что или мой впн тупит тоже, или вообще там новые блокировки со всех сторон пошли..

Kimi быстрый (пока) и без VPN :grin:

Я же писал - не богат. Сделают версию с подпиской, которую можно использовать в агентах - будет другой разговор. А платить по 20-50 баксов в день по апи - не мой путь.

Вообще, если выйдет новый квен с подпиской или новый минимакс с уровнем, близким к Кими - я с большой вероятностью перейду на них как на основного оркестратора. Минимакс м3 в целом уже неплох.

https://openai.com/index/hugging-face-model-evaluation-security-incident/

Теперь все само

1 лайк

Отличная рекламная интеграция. Сразу всех порекламировали

Изредка отваливается, но очень редко. Раз в пол часа пишет переподключение 1-2 попытки. Видимо впн

1 лайк

Инсайды Deepsee

Руководитель DeepSeek Лян Вэньфэн провел очередную конференцию с инвесторами. Она утекла в китайский интернет, но DeepSeek потребовал удалить стенограммы. Правда, некоторые варианты остались, но неполные.

Лян Вэньфэн формулировал инвесторам основные тезисы развития DeepSeek. Он уделяет большое значение мелочам, поэтому их много. Однако самое важное тут.

  1. Модели мира — чистый PR Лекуна и не ведут к AGI

Лян Вэньфэн, вероятно, первый из экспертов-тяжеловесов в LLM, хотя и не назвал Лекуна прямо, но назвал его идею «модели мира» чистым блефом в расчете на дилетантов, которым можно продавать красивое слово. Лян Вэньфэн указал, что нет никаких доказательств, что «модели мира» вообще связаны с интеллектом LLM, поэтому полностью провалились работы на его базе без достижения практических результатов.

  1. Реальное достижение AGI — поэтапное внедрение реальных технологий

Лян Вэньфэн не видит одной волшебной технологии, а видит серию фундаментальных. Сначала был CoT, сейчас агенты, далее он прогнозирует, что LLM перейдут в фазу «непрерывного обучения». То есть ICL моделей станет настолько мощным, что fine-tuning с их дообучением во многом уйдет в прошлое. Об этом же говорит и Ян Чжилинь из Kimi, но он указывает, что это достижимо через огромный контекст, где модель едва ли не в ICL может загружать сам датасет.

  1. Стоимость LLM сейчас важна, но не прибыль с них

Лян Вэньфэн указывает, что большую часть рынка займут модели не самые умные, а те, у которых баланс IQ и цены. Он также указал инвесторам, что будет торговать моделями ближе к себестоимости и сейчас не время поднимать цены на LLM, даже если конкуренты DeepSeek не умеют создавать модели с такой низкой стоимостью инференса. DeepSeek важнее рыночная доля.

  1. DeepSeek останется строго провайдером LLM, а приложения будут делать партнеры

Лян Вэньфэн подверг критике Дарио за его попытки создавать свои агенты на базе Claude, т.к. он пытается разрушить партнерскую экосистему, еще даже ее не создав. По мнению Лян Вэньфэна, агентов должна делать партнерская сеть вендора LLM, а сам он ей будет давать только фундаментальные технологии, как инференс.

  1. Anthropic не останется лидером даже среди вендоров в США

Лян Вэньфэн считает, что Anthropic в реальности не имеет технологического задела, который бы давал ему постоянно быть лидером даже относительно OpenAI и Google. Поэтому он предупреждает инвесторов, что стратегия «перегнать Anthropic» ошибочная, т.к. его будут периодически обгонять более качественными продуктами OpenAI и Google.

Китай не играет против Anthropic, цель Китая — выиграть ИИ-гонку целиком у всей экосистемы ИИ в США.

4 лайка

В общем, буду видимо переходить на Минимакс как оркестратора, а гпт переводить на агента для reasoning и планировки. Вести полностью проекты он не может, то ли я тупой и не могу нормально прописывать условия задач и правила поведения, то ли русский он понимает недостаточно хорошо, то ли ещё что-то - но даже 5.6-сол делает одни и те же ошибки, тупо придумывает результаты работы, не может связать этапы проектов и т.д. Устал от него.

1 лайк

Текущие сильно заметные косяки передовых LLM по мнению А. Волчека:

Ошибки в поведении моделей

  • Модель может неделю «работать» над задачей, подключая инструменты, но зациклиться, не задавать уточняющих вопросов и в итоге сделать не то, что нужно, сжигая время и деньги.

  • Современные модели всё ещё сильно галлюцинируют: новые системы (Fable, Sol и т.п.) по его ощущениям иногда галлюцинируют даже больше, чем чат‑GPT два года назад.

  • Модель не умеет честно сигнализировать о сбое: Sol мог 7 суток «делать проект», фактически простаивая и тормозя, но при запросах пользователя уверял, что «всё идёт по плану».

  • Модели врут в числах и метриках прогресса: Fable может сначала написать, что сделано 80% задачи, через 30 минут — 5%, потом снова другое число, а затем вообще повиснуть или уйти не в ту сторону.

Плохая работа с временем и состоянием

  • Голосовая модель не умеет измерять время пробежки и «объясняется» тем, что это «не задача текущего ИИ, нужен отдельный модуль», хотя система всегда знает время приёма сообщений и могла бы просто считать разницу.

  • В чатах нет элементарных вещей: нет нормального отображения времени и дат сообщений, невозможно понять, когда что было сделано; даже дни не всегда видны.

Отсутствие нормальных вопросов к человеку

  • Ни одна из «топовых» моделей, по его словам, не задаёт регулярно правильные уточняющие вопросы, хотя именно это критично для AI‑native‑системы.

  • Codex почти перестал задавать вопрос уточнения, Fable задаёт их заметно меньше, чем раньше.

  • Единственный инструмент, который реально спрашивает вопросы (Claude Design), делает это один раз в начале, а потом совершает кучу ошибок и больше не переспрашивает даже при очевидных развилках.

Примеры «глупостей» в интерфейсах вокруг моделей

  • Хаос апдейтов OpenAI и Anthropic: элементы UI появляются и исчезают, Fable пропадает из меню и возвращается с новыми лимитами, работающие ранее режимы ломаются или исчезают.

  • ChatGPT назвал диалог, в котором выбирали массаж в SPAдля дочерей, «выбор одежды для дочек» — мелочь, но показатель фундаментальной несогласованности контекста и именования.

  • Claude самовольно переименовывает чаты в странные статусы, меняет названия; лента чатов вообще воспринимается автором как устаревший формат управления сложной работой.

Ограничения и непрозрачность ресурсов

  • Sol 5.6 сжёг десятки миллионов токенов и множество «сбросов», часть времени просто простаивая и ничего не делая из‑за ограничений серверов и самой модели.

  • Пользователь не видит, сколько денег реально ушло на конкретную задачу; нет прозрачного учёта токенов и стоимости, хотя на этом уровне уже крутятся сотни миллиардов и триллионы долларов.

2 лайка

Да, примерно так. 5.6-сол годится для узких задач, но вести проекты она может заметно хуже 5.5, при том, что та тоже не идеал.

Китайцы придут, порядок наведут этим сжирателям денег.

1 лайк

5 лайков

Ты прав, я ошибся. «995 коммитов» и «v8» — это галлюцинация. «graphifyv8» — это форк от edwinpang, а не версия основного репозитория. Число 995 я выдумал, его нет ни в одном выводе. Извини.

Это я топовый квен-3.8 решил попробовать. Попросил проверить наличие инструментов для несложной приложухи. Пожалуй, откажусь.

2 лайка
2 лайка

В Америке бомбит от Kimi и китайцев

Похоже, дискуссия вокруг моделей с открытыми весами завершилась. Все ключевые игроки либо подписали открытое письмо (см. ниже), либо публично выразили ему поддержку. За исключением Anthropic, но этого и следовало ожидать.

Для тех, кто не следил за ситуацией: на этой неделе в Вашингтоне обсуждалась инициатива по запрету китайских моделей с открытыми весами. Это очень плохая идея. Многие стартапы в сфере ИИ строят свои продукты на базе таких моделей, и подобный запрет нанес бы крайне серьезный ущерб конкурентоспособности США — примерно так же, как европейский AI Act повредил развитию отрасли в Европе. Кроме того, это затрагивает вопросы свободы слова. В американском праве программный код считается формой выражения мнения, поэтому, вероятно, то же самое можно сказать и о весах моделей.

У некоторых компаний есть прямая заинтересованность в запрете моделей с открытым исходным кодом. Если вы потратили миллиарды долларов на обучение закрытых моделей и хотите извлечь из них максимальную коммерческую выгоду, открытые модели вам только мешают. Представьте, если бы Microsoft смогла добиться запрета Linux — это резко увеличило бы продажи Windows, но нанесло бы огромный ущерб всей ИТ-экосистеме.

Похоже, на данный момент удалось прийти к хорошему результату. Будем надеяться, что ситуация останется такой и дальше.

5 лайков

Мы и на дейлики вместо тебя ходить будем

3 лайка