// личный канал‑лог
gavrilovlog
← все записи

А кто какими LLM-ками пользовался?

👁 3361💬 18
Кто-то пробовал уже сам ставить на тачку LLM-ки разные?

Комментарии · 18

  • @ezdevnull
    ollama.com не вариант?
    • @kirill_s_gavr
      Вариант, а еще?
      • @ezdevnull
        смотря под какие нужды
        • @kirill_s_gavr
          Да просто, вопрос же в общем, кто какие пробовал и какие на тачку ставил
          • @ezdevnull
            текстовые много юзаю (в основном через ollama, тот же qwen, deepseek и их вариации), немного аудио
            • @kirill_s_gavr
              локально или на сервак ставил?
              • @ezdevnull
                локально
  • @kirill_s_gavr
    Я тут у ScaleWay увидел, что можно развернуть любую LLMку, правда там прайсы дикие из-за GPU
    • @ezdevnull
      практически все из этого списка доступно в ollama из коробки
      • @kirill_s_gavr
        llama 3.3 на 70b параметров очень больно кусается
      • @kirill_s_gavr
        Это да, я сейчас выбираю вариант приватной LLM для корпоративного использования
        • @ezdevnull
          по той же причине локально и приходится юзать
  • @kirill_s_gavr
    Есть еще варик такой, на hetzner поднять дедик за 900 бачей и туда накатить llama 3.3 70b по факту должно хватить на команду из 5 - 7 человек.
    • @ezdevnull
      хетцнер не юзаем. все на aws. но решили именно эти вещи все же юзать локально
  • @nikitosnik
    Могу накинуть еще 2 варианта: 1) https://openrouter.ai/, который поддерживает все важные модели по адекватным ценам по модели PAYG (и поддерживает оплату криптой😁)
  • @nikitosnik
    2) https://vast.ai/ Очень дешевая аренда vm+gpu, но есть сомнения по sla так как это маркетплейс
  • @nikitosnik
    А если прям локально, то ollama / llama.cpp + модели, которые занимают до 5-6гб RAM в GPU Из самых последних - Qwen https://huggingface.co/collections/unsloth/qwen3-680edabfb790c8c34a242f95
  • @shaurgon
    Ты попинай те же нейросетки, чтобы дали совет под твои требования. Мне Grok подсказал развернуть модельку в олламе, которая хорошо с русским языком дружит. Итого, на M4 сейчас локально развернута моделька на 400 метров, выдрана конфля и нейронка вполне справляется с ответами на вопросы оттуда