Quantização em 8-bit. Quase indistinguível do float16. Usa muitos recursos e é mais lento.
Observação
: os valores de RAM acima não pressupõem descarregamento de GPU. Se as camadas forem descarregadas para a GPU, isso reduzirá o uso de RAM e usará VRAM.
Como executar com
llama.cpp
Usei o seguinte comando. Para melhores resultados forneça exemplos de resultados esperados. Exemplo:
GGUF é um novo formato introduzido pela equipe llama.cpp em 21 de agosto de 2023. É um substituto para o GGML, que não é mais suportado pelo llama.cpp.
O principal benefício do GGUF é que ele é um formato extensível e à prova de futuro que armazena mais informações sobre o modelo como metadados. Ele também inclui código de tokenização significativamente melhorado, incluindo pela primeira vez suporte total para tokens especiais. Isso deve melhorar o desempenho, especialmente com modelos que usam novos tokens especiais e implementam modelos de prompt personalizados.
Aqui está uma lista de clientes e bibliotecas que são conhecidos por suportar GGUF:
lollms-webui
- Lord of Large Language Models Web User Interface
text-generation-webui
, a interface web mais amplamente utilizada. Suporta GGUF com aceleração GPU via backend ctransformers - backend llama-cpp-python deve funcionar em breve também.
KoboldCpp
, agora suporta GGUF a partir da versão 1.41! Uma poderosa interface web GGML, com aceleração total da GPU. Especialmente bom para contar histórias.
LM Studio
, versão 0.2.2 e posteriores suportam GGUF. Uma GUI local totalmente equipada com aceleração GPU em ambos Windows (NVidia e AMD) e macOS.
LoLLMS Web UI
, agora deve funcionar, escolha o backend c_transformers. Uma ótima interface web com muitos recursos interessantes. Suporta aceleração GPU CUDA.
ctransformers
, agora suporta GGUF a partir da versão 0.2.24! Uma biblioteca Python com aceleração GPU, suporte LangChain e servidor AI compatível com OpenAI.
llama-cpp-python
, suporta GGUF a partir da versão 0.1.79. Uma biblioteca Python com aceleração GPU, suporte LangChain e servidor API compatível com OpenAI.
candle
, adicionou suporte GGUF em 22 de agosto. Candle é um framework ML Rust com foco em desempenho, incluindo suporte GPU e facilidade de uso.
LocalAI
, adicionou suporte GGUF em 23 de agosto. LocalAI provê uma API Rest para modelos LLM e de geração de imagens.
Jan
, similar ao LM Studio, porém complemetamente open-source
Template
### Instrução:
{prompt}
### Resposta:
Runs of lucianosb boto-7B-GGUF on huggingface.co
300
Total runs
8
24-hour runs
44
3-day runs
87
7-day runs
36
30-day runs
More Information About boto-7B-GGUF huggingface.co Model
boto-7B-GGUF huggingface.co is an AI model on huggingface.co that provides boto-7B-GGUF's model effect (), which can be used instantly with this lucianosb boto-7B-GGUF model. huggingface.co supports a free trial of the boto-7B-GGUF model, and also provides paid use of the boto-7B-GGUF. Support call boto-7B-GGUF model through api, including Node.js, Python, http.
boto-7B-GGUF huggingface.co is an online trial and call api platform, which integrates boto-7B-GGUF's modeling effects, including api services, and provides a free online trial of boto-7B-GGUF, you can try boto-7B-GGUF online for free by clicking the link below.
lucianosb boto-7B-GGUF online free url in huggingface.co:
boto-7B-GGUF is an open source model from GitHub that offers a free installation service, and any user can find boto-7B-GGUF on GitHub to install. At the same time, huggingface.co provides the effect of boto-7B-GGUF install, users can directly use boto-7B-GGUF installed effect in huggingface.co for debugging and trial. It also supports api for free installation.