Prova Completa: Tecnologista - Cientista de Dados em Saúde (FIOCRUZ

3862199 Ano: 2024
Disciplina: TI - Gestão e Governança de TI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Gestão da Informação

Você é um cientista de dados incumbido de desenvolver uma aplicação de perguntas e respostas para facilitar a extração de informações de documentos PDF contendo artigos científicos na área da saúde. Para construir essa aplicação, as seguintes estratégias foram apresentadas.

I. Utilizar a técnica de embeddings de texto para converter documentos PDF em vetores e armazená-los em um vectorstore, como ChromaDb ou Pinecone, permitindo buscas semânticas rápidas e eficientes baseadas no conteúdo dos artigos.

II. Desenvolver um sistema de indexação baseado em metadados extraídos dos documentos PDF, como autor, data de publicação e palavras-chave, para facilitar a filtragem e a busca por documentos específicos.

III. Implementar uma abordagem de processamento de linguagem natural (PLN) que empregue a API do modelo de linguagem para gerar respostas precisas às perguntas, utilizando os vetores e metadados armazenados para recuperar informações relevantes dos documentos e inseri-las no contexto do prompt.

IV. Realizar o fine-tuning do modelo de linguagem através de um dataset que contenha o conhecimento do domínio que se quer adicionar ao modelo, utilizando frameworks como LoRA ou QLoRA para fazer o merge desse dataset adicional treinado.

V. Criar uma hierarquia de documentos baseada na classificação dos artigos científicos por tópicos e subtópicos, utilizando algoritmos de clustering para organizar automaticamente os documentos em categorias relevantes.

Das estratégias acima:

Provas

Questão presente nas seguintes provas

3862198 Ano: 2024
Disciplina: TI - Ciência de Dados e BI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Acerca dos frameworks LangChain e Llamaindex, amplamente utilizados atualmente para construir aplicação integradas a Large Language Models (LLMs), a opção que apresenta uma observação correta é:

A

LlamaIndex é um framework projetado para aplicações que utilizam LLMs que se beneficiam de aumento de contexto, fornecendo abstrações que facilitam a ingestão, estruturação e acesso a dados independente de um domínio específico.

B

no LangChain, chains são sequências de chamadas a um LLM, ferramenta ou etapa de pré-processamento de dados, permitindo a criação de pipelines complexos sem necessidade de linguagem específica.

C

LangChain pode ser utilizado para tarefas como classificação de texto e tradução automática, mas não para extração de entidades nomeadas e geração de texto.

D

LLamaindex não oferece suporte à busca semântica, não permitindo que os usuários realizem buscas por documentos que contenham conceitos relacionados aos termos de busca.

E

no LangChain, chains implementam uma sequência de ações através de código, ao contrário de agents, onde um modelo de linguagem é utilizado como motor de raciocínio para determinar as ações a serem tomadas.

Provas

Questão presente nas seguintes provas

3862197 Ano: 2024
Disciplina: TI - Gestão e Governança de TI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Gestão da Informação

Ao integrar informações provenientes de fontes de dados externas, como documentos ou bancos de dados, com Large Language Models (LLMs), é possível empregar uma variedade de técnicas e estratégias para construir aplicações adaptadas às demandas específicas de cada projeto e aos recursos disponíveis.
Das opções abaixo, a que descreve corretamente uma dessas técnicas é:

A

Prompt engineering é a prática de reduzir a complexidade dos modelos de linguagem de IA, simplificando-os para que reconheçam e respondam apenas a comandos básicos de uma palavra, evitando qualquer tipo de prompt contextualizado ou frase mais complexa.

B

Few-Shot Learning é uma abordagem que envolve treinar o modelo com pouco exemplos adicionais e específicos, denominados shots. O modelo usa esses exemplos para entender melhor o contexto ou a tarefa específica solicitada, permitindo que ele generalize a partir de poucos dados e aplique o aprendizado a situações semelhantes.

C

Retrieval-Augmented Generation (RAG) é uma técnica que combina a geração de texto de um LLM com um sistema de recuperação de informações; o modelo original é treinado com uma base de dados ou um conjunto de documentos específico, permitindo a incorporação de novos conhecimentos que não estavam presentes no corpus de treinamento original do modelo.

D

Fine-Tuning é um processo de ajuste fino que consiste em treinar um LLM com um dataset adicional, com o objetivo de personalizar o modelo para tarefas ou domínios específicos. Isso permite que o modelo adapte suas respostas com base no conhecimento ou nos dados contidos nesse dataset adicional.

E

Text-to-SQL é uma funcionalidade padrão integrada em todas as versões do SQL que automaticamente traduz instruções em linguagem natural para comandos SQL, eliminando a necessidade de conhecimento técnico em bancos de dados para a realização de consultas complexas.

Provas

Questão presente nas seguintes provas

3862196 Ano: 2024
Disciplina: TI - Gestão e Governança de TI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Gestão da Informação

Considerando o avanço recente dos modelos de Processamento de Linguagem Natural (PLN) e a necessidade crescente de processar e sumarizar grandes volumes de documentos de forma eficiente, você foi encarregado de desenvolver uma aplicação capaz de sumarizar automaticamente documentos clínicos, proporcionando aos profissionais de saúde acessos mais rápidos e precisos às informações relevantes dos pacientes. Um aspecto primordial no desenvolvimento de aplicações de sumarização é a avaliação dos sumários gerados, na medida em que os usuários passam a confiar nesses sumários para tomada de decisão.
Sobre avaliação de sumários, a opção que NÃO apresenta um modelo adequado para esta tarefa é:

Provas

Questão presente nas seguintes provas

3862195 Ano: 2024
Disciplina: Saúde Pública
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Epidemiologia e Vacinação

O uso de Large Language Models (LLMs) na área da saúde, como GPT e BERT, oferece um vasto campo de possibilidades para inovação. Atualmente, é possível criar uma série de aplicações que fazem uso dessas LLMs, variando desde melhorias da qualidade e acessibilidade a conhecimentos até o apoio a novas pesquisas na área. Entre as opções abaixo, aquela que apresenta uma iniciativa que NÃO pode ser baseada no uso de LLMs é:

A

LLMs podem ser utilizadas para extrair informações críticas de registros médicos eletrônicos, notas de alta hospitalar e literatura científica, transformando dados não estruturados em insights valiosos para a pesquisa clínica e epidemiológica.

B

LLMs podem ser utilizadas para processar informações textuais sobre genética e biomarcadores, incluindo sequências de DNA/RNA, realizar análises genéticas complexas e interpretar dados laboratoriais brutos.

C

LLMs podem automatizar a criação de relatórios de pesquisa, sumários de políticas de saúde e comunicados à imprensa, facilitando a disseminação rápida de informações importantes para o público e a comunidade científica.

D

LLMs podem analisar extensas bases de dados de literatura científica para identificar padrões, tendências e lacunas no conhecimento, gerando novas hipóteses para pesquisa em saúde pública.

E

LLMs podem analisar dados de fontes abertas e redes sociais para detectar e monitorar surtos de doenças em tempo real, permitindo respostas rápidas a emergências de saúde pública.

Provas

Questão presente nas seguintes provas

3862194 Ano: 2024
Disciplina: TI - Ciência de Dados e BI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Inteligência ArtificialMachine LearningAplicaçõesIA Generativa e LLMs

A evolução das tecnologias de Inteligência Artificial, especialmente no campo do Processamento de Linguagem Natural (PLN), tem sido marcada por inovações significativas que transformaram a maneira como as máquinas entendem e geram linguagem humana. Uma dessas inovações é a arquitetura de Transformers, introduzida pelo artigo Attention is All You Need em 2017, superando as limitações das abordagens anteriores baseadas em Redes Neurais Recorrentes (RNNs) e tornando-se a base fundamental para o surgimento dos Large Language Models (LLMs).
Sobre essa arquitetura, pode-se afirmar que:

A

a arquitetura dos Transformers depende exclusivamente de camadas recorrentes para processar sequências de texto, o que melhora a eficiência computacional em comparação com as RNNs.

B

os Transformers introduziram o conceito de atenção seletiva, permitindo que modelos focassem em partes relevantes do texto ao gerar respostas, algo que as RNNs não podem fazer.

C

os Transformers utilizam mecanismos de atenção que permitem a modelagem de dependências de longo alcance sem a necessidade de processamento sequencial, superando as limitações das RNNs.

D

a arquitetura dos Transformers substituiu as unidades de processamento baseadas em regras pelas redes neurais, o que não era possível com as RNNs.

E

a arquitetura dos Transformers elimina a necessidade de encoders e decoders, diferenciando-se das RNNs que dependem dessa estrutura para o Processamento de Linguagem Natural.

Provas

Questão presente nas seguintes provas

3862193 Ano: 2024
Disciplina: TI - Desenvolvimento de Sistemas
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Linguagens

Você é um cientista de dados trabalhando em um projeto de pesquisa em saúde que envolve a análise de relatórios médicos utilizando técnicas de Processamento de Linguagem Natural (PLN). Parte do seu trabalho é explorar as relações semânticas entre diferentes condições de saúde utilizando um modelo pré-treinado de word embeddings em português, focado na área da saúde. Você decide investigar a relação entre diferentes doenças e tratamentos.

Seja o seguinte código Python, que utiliza a biblioteca gensim e um modelo hipotético de word embeddings denominado modelo_saude.bin especializado em termos médicos em português:

import numpy as np from gensim.models import KeyedVectors
def calcular_similaridade(vetor_a, vetor_b): numerador = np.dot(vetor_a, vetor_b) denominador = np.linalg.norm(vetor_a) *
np.linalg.norm(vetor_b) similaridade = numerador / denominador return similaridade
mo del = Ke yed Vectors. load_ word 2vec _ format(‘modelo_saude.bin’, binary=True) vetor_diabetes = model[‘diabetes’] vetor_hipertensao = model[‘hipertensão’] vetor_insulina = model[‘insulina’]
vetor_diabetes_ajustado = vetor_diabetes + vetor_insulina vetor_hipertensao_ajustado = vetor_hipertensao + vetor_insulina
similaridade = calcular_similaridade(vetor_ diabetes_ajustado, vetor_hipertensao_ajustado) print(f”Similaridade: {similaridade}”)

Utilizando o modelo hipotético model_saude.bin, o resultado mostrado pelo código foi de 0.7036085724830627. Baseado no cenário descrito, no código fornecido e no resultado mostrado, a opção que melhor descreve o que está sendo calculado e o significado do resultado é:

A

a distância euclidiana entre os vetores de “diabetes” e “hipertensão”, ambos ajustados pelo vetor de “insulina”, sugere que, no espaço semântico do modelo utilizado, as condições de “diabetes” e “hipertensão”, quando consideradas no contexto do tratamento com “insulina”, possuem uma relação semântica relativamente forte.

B

a similaridade por cosseno entre os vetores de “diabetes” e “hipertensão”, ambos ajustados pelo vetor de “insulina”, sugere que, no espaço semântico do modelo utilizado, as condições de “diabetes” e “hipertensão”, quando consideradas no contexto do tratamento com “insulina”, possuem uma relação semântica relativamente fraca.

C

a distância euclidiana entre os vetores de “diabetes” e “hipertensão”, ambos ajustados pelo vetor de “insulina”, sugere que, no espaço semântico do modelo utilizado, as condições de “diabetes” e “hipertensão”, quando consideradas no contexto do tratamento com “insulina”, possuem uma relação semântica relativamente fraca.

D

a similaridade por cosseno entre os vetores de “diabetes” e “hipertensão”, ambos ajustados pelo vetor de “insulina”, sugere que, no espaço semântico do modelo utilizado, as condições de “diabetes” e “hipertensão”, quando consideradas no contexto do tratamento com “insulina”, possuem uma relação semântica relativamente forte.

E

a distância euclidiana entre os vetores de “diabetes” e “hipertensão”, ambos ajustados pelo vetor de “insulina”, sugere que, no espaço semântico do modelo utilizado, as condições de “diabetes” e “hipertensão”, quando consideradas no contexto do tratamento com “insulina”, possuem uma relação semântica relativamente neutra.

Provas

Questão presente nas seguintes provas

3862192 Ano: 2024
Disciplina: TI - Ciência de Dados e BI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Inteligência ArtificialConceitos e Fundamentos de IA

Entre as observações abaixo sobre a técnica de Word Embeddings e sua importância em modelos de Processamento de Linguagem Natural (PLN), a que está correta é:

A

são algoritmos de criptografia que protegem palavras em um texto para garantir sua privacidade e suas relações semânticas, por isso são essenciais para a segurança e compreensão em aplicações de PLN.

B

são listas de sinônimos para palavras utilizadas em PLN, permitindo que sistemas de computador compreendam a variedade de vocabulário na linguagem humana e suas relações semânticas.

C

são representações vetoriais que capturam relações semânticas e sintáticas; são fundamentais para melhorar a precisão de modelos de PLN, ao permitir que computadores interpretem nuances de significado.

D

são técnicas de compressão de texto que reduzem o tamanho dos dados de linguagem para armazenamento eficiente em bancos de dados de PLN, enquanto permitem compreender suas relações semânticas.

E

são marcações automáticas de cada palavra em um texto com sua parte correspondente do discurso para análise semântica e sintática em PLN.

Provas

Questão presente nas seguintes provas

3862191 Ano: 2024
Disciplina: TI - Desenvolvimento de Sistemas
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Fundamentos de ProgramaçãoAlgoritmosConceitos Básicos de Algoritmos
Linguagens

Observe o código Python abaixo, que utiliza a biblioteca NLTK para tarefas de Processamento de Linguagem Natural.

import nltk nltk.download(‘punkt’) from nltk.tokenize import word_tokenize
texto = “Fundação Oswaldo Cruz (Fiocruz): Ciência e tecnologia em saúde para a população brasileira.” tokens = word_tokenize(texto)
contador = 0 resultado = 0 while contador < len(tokens): for letra in tokens[contador]: if letra.upper() in ‘FIOCRUZ’: resultado += 1 contador += 1

O valor da variável resultado, ao final da execução do código, é:

Provas

Questão presente nas seguintes provas

3862190 Ano: 2024
Disciplina: TI - Ciência de Dados e BI
Banca: FIOCRUZ
Orgão: FIOCRUZ

Provas:

Tecnologista - Cientista de Dados em Saúde
Provas ×

Inteligência ArtificialConceitos e Fundamentos de IA

O Processamento de Linguagem Natural (PLN) busca melhorar a capacidade das máquinas de entender e interagir com a linguagem humana de forma natural e semanticamente adequada. Ao longo dos anos, a evolução dos modelos de Machine Learning tem desempenhado um papel fundamental nesse processo, permitindo avanços significativos em tarefas como tradução automática, análise de sentimentos e assistentes virtuais. Esses modelos dependem de uma série de técnicas de pré-processamento para transformar texto bruto em formas que possam ser eficientemente analisadas e compreendidas. Numere a 2ª coluna pela primeira, considerando as técnicas e as respectivas definições.

COLUNA 1
(1) Tokenização, (2) POS Tagging, (3) Stemização, (4) Lematização e (5) Chunking.
COLUNA 2
( ) Técnica que transforma uma palavra para sua forma de dicionário, considerando o contexto, a classe gramatical e outras características linguísticas.

( ) Trata de dividir o texto em unidades menores, como palavras ou partes de palavras, transformando o texto bruto e preparando-o para ser manipulado por algoritmos de PLN.

( ) Refere-se a reduzir as palavras para suas formas radicais, facilitando a análise de padrões comuns em diferentes variações da mesma palavra.

( ) Técnica de atribuir a cada palavra em um texto a sua classe morfossintática, como substantivos, verbos, adjetivos, etc.

( ) Trata de dividir um texto em segmentos mais curtos, como conjuntos de palavras ou seções de um texto, que serão tratados separadamente em processos posteriores como, por exemplo, vetorização.

A sequência correta, de cima para baixo, é: