">
 

Day 9 - Sparse embedding continued - RAG

Iniciado por joomlamz, 28 de Maio de 2026, 05:00

Respostas: 1   |   Visualizações: 15

Tópico anterior - Tópico seguinte

0 Membros e 1 Visitante estão a ver este tópico.

**Guia para Iniciantes em EC2: Lançamento da Primeira Instância AWS**

O guia "EC2 Beginner Guide: Launch Your First AWS Instance" é um recurso valioso para aqueles que estão começando a explorar o mundo da computação em nuvem com a Amazon Web Services (AWS). A partir deste guia, podemos destacar alguns pontos principais que são essenciais para entender e aproveitar ao máximo os recursos da EC2.

**Pontos Principais:**

1. **Introdução à EC2:** A EC2 (Elastic Compute Cloud) é um serviço da AWS que permite criar e gerenciar máquinas virtuais na nuvem. Isso significa que os usuários podem criar instâncias de servidor virtuais personalizadas para atender às suas necessidades específicas, sem a necessidade de investir em hardware físico.

2. **Tipos de Instâncias:** A AWS oferece uma variedade de tipos de instâncias, cada uma projetada para atender a diferentes necessidades de processamento, memória e armazenamento. Isso permite aos usuários escolher o tipo de instância que melhor se adapta às suas necessidades, otimizando assim os custos e o desempenho.

3. **Lançamento da Primeira Instância:** O guia fornece passos detalhados sobre como lançar a primeira instância EC2. Isso inclui a escolha do sistema operacional, a configuração da instância, e a conexão com a instância usando SSH ou RDP, dependendo do sistema operacional escolhido.

4. **Segurança:** A segurança é um aspecto crucial ao trabalhar com a EC2. O guia aborda a importância de configurar grupos de segurança, chaves de acesso e outras medidas de segurança para proteger as instâncias e os dados.

**Debate e Discussão:**

Este guia serve como um ponto de partida para explorar as capacidades da EC2 e da AWS como um todo. No fórum webmastersmz.com, convido todos a compartilharem suas experiências e dúvidas sobre o uso da EC2 e da AWS. Qual é o seu caso de uso para a EC2? Quais desafios você enfrentou e como os superou? A discussão e o compartilhamento de conhecimentos são essenciais para o crescimento e o aprendizado de todos.

**Convidando para a AplicHost:**

Para garantir que os vossos projetos e fóruns rodam sem falhas, convido-vos a conhecer as soluções de alojamento de alta performance da AplicHost em https://aplichost.com. Com a AplicHost, você pode aproveitar a expertise em hospedagem web, soluções de armazenamento na nuvem e muito mais, tudo projetado para oferecer estabilidade, segurança e desempenho para os seus projetos online. Visite o site da AplicHost hoje mesmo e descubra como podemos ajudar a levar os seus projetos ao próximo nível.

Day 9 - Sparse embedding continued - RAG



Tópico: Day 9 - Sparse embedding continued - RAG
Categoria: Tutoriais | Programação & Tecnologia
Idioma Principal: Português (Conteúdo de Tecnologia)

Descrição do Conteúdo / Informações:
-------------------------------------------------------------------------
In the previous post, we saw some basic methodologies under sparse embeddings. In that, term frequency(TF) had a fallback when same words are repeated too often. To overcome the shortcomings of TF, next method was introduced. We shall see them in detail:

Inverse document frequency(IDF)

It determines how less frequent a word occurs in the input documents. It calculates how the rare the word is. Rare word is of high priority. i.e If the word occurs less frequent, then the value will be high and if if the word occurs more frequently, then the value will be low.

If i ask query about frequently occurring words (for which IDF score is low), results will not be that good. On the other hand, if i ask query about rarest word(IDF score is high), results will be comparatively good.

Drawbacks of IDF

If i ask query about kubernetes and if the word is occurring only in one document , that particular document will be returned. There will be chances where the doc will have mention of kubernetes once but does not describe in detail about it. In such cases, returned doc is not that useful

TF-IDF

This combines both TF and IDF. i.e For a word its TF score will be multiplied with IDF.

BM-25(Best match-25)

Next improved version of TF-IDF is BM-25 algorithm. 25 refers to top 25 matching words. This may yield better result when compared to TF-IDF.

As sparse embedding(s.e) does keyword search, We cannot use s.e alone in a RAG pipeline. To make the best of both worlds, we need to combine dense embeddings (semantic similarity) and sparse embedding(keyword search). This is called hybrid search For dense embedding we can use sentence transformer and for sparse embedding we can use BM-25 algorithm.


Joomlamz
Consultoria em Informática
-------------------------------------------------------
Especialista em Sistemas Web & Manutenção de Servidores.
A desenvolver o novo AplPortal com suporte a PHP 8.
Precisa de ajuda profissional? Contacte-me.

Tags: