Não reclamado: estamos trabalhando em Hive ?
Hive Comentários: 4.2/5 — Uma ótima escolha
O Hive é uma ferramenta de gerenciamento de projetos completa desenvolvida para “ajudar as equipes a se moverem mais rapidamente”, independentemente de como trabalham. Os recursos são criados com base nas solicitações dos usuários e são atualizados semanalmente, tornando o Hive a primeira plataforma de software democrática do mundo. É mais conhecido por seus recursos em gerenciamento de projetos, gerenciamento de tempo, colaboração em equipe, automação e uma variedade de integrações com software de terceiros. O uso do Hive é gratuito para usuários individuais e com versões premium disponíveis para equipes e empresas.
| Capacidades |
API
|
|---|---|
| Segmento |
Negócio pequeno
mercado médio
Empreendimento
|
| desenvolvimento | Nuvem/SaaS/baseado na Web, Android móvel, iPad móvel, iPhone móvel |
| Suporte | 24 horas por dia, 7 dias por semana (representante ao vivo), bate-papo, e-mail/Help Desk, perguntas frequentes/fórum, base de conhecimento, suporte por telefone |
| Formação | Documentação |
| Idiomas | Inglês |
Comparar Hive com outras ferramentas populares na mesma categoria.
Interface fantástica e atraente. Simples e direta no que diz respeito ao rastreamento, atribuição e monitoramento de projetos. O Hive me ajuda a acompanhar todos os nossos projetos e as pessoas conectadas a eles.
Até o momento, não tenho nada a dizer que não goste. Estou satisfeito com o uso do Hive.
Gerenciar os projetos e obter os registros de tempo.
O Hive é o melhor data warehouse de código aberto. Fácil de usar, possui uma linguagem de consulta chamada HiveQL, cuja sintaxe é semelhante à do SQL. Portanto, é fácil escrever consultas Hive e obter relatórios e insights de negócios. Excelente para análise de dados. Além disso, integra-se facilmente com Spark, Hadoop e nuvem.
A maior latência é a desvantagem. Devem ser feitos desenvolvimentos para melhorar a latência das consultas complexas.
Nos ajudando a obter insights e relatórios de negócios. Nos ajudando a analisar os dados e tirar conclusões para melhorar os negócios.
A melhor característica do Hive é a possibilidade de escrever código SQL para processar e gerenciar os dados. Ele permite particionar e distribuir os dados entre as máquinas do cluster. Também é possível escolher um mecanismo de execução como Spark, Tez ou MAPredict ao executar os dados no Hive. Se você precisa processar e analisar grandes volumes de dados em lote, o Hive é a melhor opção.
Suporta apenas dados estruturados e não permite atualizações. Suporta somente OLAP.
Gerenciamos nosso data warehouse para fins analíticos usando o Hive. Costumávamos particionar e agrupar as tabelas para melhor processamento paralelo e menos embaralhamento, otimizando assim o processamento. Também utilizávamos o Spark para ler as tabelas do Hive, visando maior velocidade e eficiência computacional.
Boa capacidade de consulta em bancos de dados Hive e facilidade para criar esquemas.
Não permite a conversão de tipos de dados, pois isso resultaria em perda de dados.
Consultas em bancos de dados Hive. Também em HS2 e no metastore do Hive, resultando em resultados rápidos.
Esquema em arquivos HDFS de qualquer formato. Fácil de baixar os dados. Uma ferramenta completa, similar a ferramentas de banco de dados como o Toad.
O desempenho às vezes é muito difícil de executar. A interface gráfica pode ser melhorada com opções mais amigáveis ao usuário.
Processamento de dados para relatórios regulatórios ...manter a linhagem
Fui um grande fã do Impala por um tempo, até me deparar com uma série de limitações impossíveis de superar. Trabalho muito com arrays e o simples fato de poder usar o `array_contains` no Impala me fez migrar para o Hive. Além disso, estamos avançando rapidamente na direção de uma macro própria para o Hive, que nos permite realizar consultas complexas sem que as visões laterais explodam.
A criação de sessão demora um pouco e a velocidade é bastante lenta em comparação com o Impala.
Análise de dados complexa com tabelas que possuem vários bilhões de linhas por partição.
É extremamente flexível em termos de configuração. Há muitas opções para carregar dados — diretamente do sistema de arquivos Linux ou do HDFS. Você pode criar tabelas externas e gerenciadas. Um recurso interessante é a possibilidade de executar comandos bash diretamente do Hive.
Não pode ser usado para streaming de dados. O registro de erros pode ser aprimorado para que o rastreamento e a resolução de erros sejam mais eficientes.
É utilizado para transformar e processar conjuntos de dados Big Data em lotes. Ele pode lidar com terabytes de dados. O recurso de predicado push melhorou significativamente o desempenho das consultas e o desenvolvedor não precisa mais se preocupar com isso.
O Hive é excelente para lidar com logs em projetos de Big Data. Estamos usando-o em nosso projeto e ele é ótimo para realizar junções e agrupamentos, que são muito difíceis e complexos no MapReduce. Possui muitos pacotes de UDFs e é muito fácil adicionar novas UDFs. Também usamos bucketing e clustering para otimizar as consultas. O conceito de tabelas externas e a maneira como podemos manipular os dados mesmo quando a tabela é excluída do Hive é realmente incrível. Há muitos conectores disponíveis no mercado para diferentes softwares.
O que me incomoda é a latência e a forma como os dados são salvos. Ao inserir dados, tenho que esperar muito tempo por alguns registros. O plano de execução do compilador é muito imaturo, pois não realiza uma otimização de consulta adequada. Embora a comunidade esteja trabalhando rapidamente para superar esses problemas, acredito que ainda levará tempo para o Hive se tornar um sistema eficiente.
Utilizamos o Hive principalmente para salvar nossos logs. Ele nos ajuda a acompanhar quais registros foram inseridos, quais registros falharam e qual o relacionamento entre eles. Utilizamos o Tableau para analisar os dados.
A evolução das funcionalidades, a velocidade, etc., me trazem a confiança estratégica que preciso no contexto de SQL em Hadoop.
Neste momento, tudo está em aberto e as teorias são ótimas no Hive 1.2.
Extraindo valor de grandes quantidades de dados estruturados e não estruturados.
1) Capacidade de lidar com dados em escala de petabytes; 2) Capacidade de trabalhar com linguagem de consulta próxima ao SQL; 3) Capacidade de leitura de esquema.
1) A tecnologia de otimização ainda está em fase de amadurecimento.
1) Manipulação de conjuntos de dados enormes; 2) Manipulação de conjuntos de dados semiestruturados e estruturados com a mesma ferramenta.