> For the complete documentation index, see [llms.txt](https://bithoventech.gitbook.io/prompt-inzhiniring-ot-bithoven-ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://bithoventech.gitbook.io/prompt-inzhiniring-ot-bithoven-ai/modeli/llama.md).

# LLaMA

Открытые и эффективные базовые языковые модели

{% hint style="danger" %}
Данный раздел находится в активной разработке.
{% endhint %}

## Что нового?

***

В данной статье представлена коллекция базовых языковых моделей (LLaMA) с числом параметров в диапазоне от 7 миллиардов до 65 миллиардов.

Модели обучаются на триллионах токенов с использованием публично доступных наборов данных.

Исследование, проведенное командой [(Hoffman et al., 2022)](https://arxiv.org/abs/2203.15556), указывает на то, что при ограниченных вычислительных ресурсах более компактные модели, обученные на более обширных наборах данных, могут достичь более высокой производительности по сравнению с их крупными аналогами. В их работе рекомендуется обучать модели с числом параметров в размере 10 миллиардов на 200 миллиардов токенов. Однако в статье о коллекции базовых языковых моделей (LLaMA) было обнаружено, что производительность модели с 7 миллиардами параметров продолжает улучшаться даже после обучения на триллионе токенов.

<figure><img src="https://3840355729-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FgFPj8AgoQsj90ueaMFr7%2Fuploads%2FiUPnhOVnHHXkpI6RpoCy%2F6%20%D1%81%D0%BA%D1%80%D0%B8%D0%BD.png?alt=media&amp;token=ee661e72-5af8-4139-9331-2f72bc8a1468" alt=""><figcaption></figcaption></figure>

В данной работе основное внимание уделяется обучению моделей из коллекции базовых языковых моделей (LLaMA), достигающих оптимальной производительности при различных ограничениях на вычислительные ресурсы, путем обучения на более обширных объемах токенов.\ <br>

## Возможности и ключевые моменты

***

В целом, модель LLaMA-13B показывает лучшие результаты по сравнению с GPT-3(175B) на многих бенчмарках, несмотря на то, что она в 10 раз меньше и может работать на одной графической карте. Модель LLaMA-65B конкурентоспособна с моделями, такими как Chinchilla-70B и PaLM-540B.

*Статья:* [LLaMA: Open and Efficient Foundation Language Models](https://arxiv.org/abs/2302.13971)

*Код:* <https://github.com/facebookresearch/llama><br>

## Ссылки

***

* [Koala: A Dialogue Model for Academic Research](https://bair.berkeley.edu/blog/2023/04/03/koala/)(Апрель 2023 г.)
* [Baize: An Open-Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data](https://arxiv.org/abs/2304.01196)(Апрель 2023 г.)
* [Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90%\* ChatGPT Quality](https://vicuna.lmsys.org/)(Март 2023 г.)
* [LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention](https://arxiv.org/abs/2303.16199)(Март 2023 г.)
* [GPT4All](https://github.com/nomic-ai/gpt4all)(Март 2023 г.)
* [ChatDoctor: A Medical Chat Model Fine-tuned on LLaMA Model using Medical Domain Knowledge](https://arxiv.org/abs/2303.14070)(Март 2023 г.)
* [Stanford Alpaca](https://github.com/tatsu-lab/stanford_alpaca)(Март 2023 г.)
