Вложенный фильтр elasticsearch возвращает пустой результат

У меня есть это отображение:

  "post": {
    "model": "Post",
    "properties": {
      "id": {
        "type": "integer"
      },
      "title": {
        "type": "string",
        "analyzer": "custom_analyzer",
        "boost": 5
      },
      "description": {
        "type": "string",
        "analyzer": "custom_analyzer",
        "boost": 4
      },
      "condition": {
        "type": "integer",
        "index": "not_analyzed"
      },
      "categories": {
        "type": "string",
        "index": "not_analyzed"
      },
      "seller": {
        "type": "nested",
        "properties": {
          "id": {
            "type": "integer",
            "index": "not_analyzed"
          },
          "username": {
            "type": "string",
            "analyzer": "custom_analyzer",
            "boost": 1
          },
          "firstName": {
            "type": "string",
            "analyzer": "custom_analyzer",
            "boost": 3
          },
          "lastName": {
            "type": "string",
            "analyzer": "custom_analyzer",
            "boost": 2
          }
        }
      },
      "marketPrice": {
        "type": "float",
        "index": "not_analyzed"
      },
      "currentPrice": {
        "type": "float",
        "index": "not_analyzed"
      },
      "discount": {
        "type": "float",
        "index": "not_analyzed"
      },
      "commentsCount": {
        "type": "integer",
        "index": "not_analyzed"
      },
      "likesCount": {
        "type": "integer",
        "index": "not_analyzed"
      },
      "featured": {
        "type": "boolean",
        "index": "not_analyzed"
      },
      "bumped": {
        "type": "boolean",
        "index": "not_analyzed"
      },
      "created": {
        "type": "date",
        "index": "not_analyzed"
      },
      "modified": {
        "type": "date",
        "index": "not_analyzed"
      }
    }
  }

И этот запрос:

GET /develop/_search?search_type=dfs_query_then_fetch
{
  "query": {
    "filtered" : {
        "query": {
          "bool": {
            "must": [
              { "match": { "title": "post" }}
            ]
          }
        },
        "filter": {
          "bool": { 
            "must": [
              {"term": {
                "featured": 0
              }},
              { 
              "nested": {
                "path": "seller",
                "filter": {
                  "bool": {
                    "must": [
                      { "term": { "seller.firstName": "Test 3" } }
                    ]
                  }
                },
                "_cache" : true
              }}
            ]
          } 
        }
    }
  },
  "sort": [
    {
      "_score":{
        "order": "desc"
      }
    },{
      "created": {
        "order": "desc"
      }
    }
  ],
  "track_scores": true
}

Я жду 25 результатов, потому что у меня проиндексировано 25 сообщений. Но я получаю пустой набор. Если я удалю вложенный фильтр, все будет работать нормально. Я хочу иметь возможность фильтровать вложенный объект

РЕДАКТИРОВАТЬ:

В моих настройках у меня есть:

    "analyzer": {
      "custom_analyzer": {
        "type": "custom",
        "tokenizer": "nGram",
        "filter": [
          "stopwords",
          "asciifolding",
          "lowercase",
          "snowball",
          "english_stemmer",
          "english_possessive_stemmer",
          "worddelimiter"
        ]
      },
      "custom_search_analyzer": {
        "type": "custom",
        "tokenizer": "standard",
        "filter": [
          "stopwords",
          "asciifolding",
          "lowercase",
          "snowball",
          "english_stemmer",
          "english_possessive_stemmer",
          "worddelimiter"
        ]
      }
    }

Чего мне здесь не хватает.

Спасибо


person bitgandtter    schedule 05.01.2015    source источник
comment
Можете ли вы опубликовать свое определение custom_analyzer? То, как это настроено, может иметь какое-то отношение к вашей проблеме.   -  person Sloan Ahrens    schedule 06.01.2015
comment
эй @SloanAhrens, я обновляю вопрос с помощью своих анализаторов   -  person bitgandtter    schedule 06.01.2015
comment
Я все еще не могу настроить индекс, подобный вашему, чтобы проверить его. Похоже, у вас тоже есть определенные пользовательские фильтры? Можете ли вы опубликовать их тоже? Некоторые образцы документов также могут быть полезны. Довольно сложно сказать вам, в чем проблема, не имея возможности смоделировать вашу систему.   -  person Sloan Ahrens    schedule 06.01.2015
comment
Однако я подозреваю, что при вашей текущей настройке { "term": { "seller.firstName": "Test 3" } } должно быть { "term": { "seller.firstName": "test" } } или что-то подобное. Или вам нужно будет настроить анализаторы/отображение. Но трудно сказать наверняка без непосредственного тестирования.   -  person Sloan Ahrens    schedule 06.01.2015
comment
@SloanAhrens по этому вопросу stackoverflow.com/ вопросов/27493452/ я публикую те же данные и сопоставление, но по другой причине, это то же самое   -  person bitgandtter    schedule 06.01.2015


Ответы (1)


Короткая версия: попробуйте это (после обновления конечной точки и имени индекса):

curl -XPOST "http://localhost:9200/my_index/_search?search_type=dfs_query_then_fetch" -d'
{
   "query": {
      "filtered": {
         "query": {
            "bool": {
               "must": [
                  {
                     "match": {
                        "title": "post"
                     }
                  }
               ]
            }
         },
         "filter": {
            "bool": {
               "must": [
                  {
                     "nested": {
                        "path": "seller",
                        "filter": {
                           "bool": {
                              "must": [
                                 {
                                    "terms": {
                                       "seller.firstName": [
                                          "test",
                                          "3"
                                       ],
                                       "execution": "and"
                                    }
                                 }
                              ]
                           }
                        }
                     }
                  }
               ]
            }
         }
      }
   }
}'

У меня это сработало с упрощенной версией вашей настройки. Через некоторое время я опубликую редактирование с более подробным объяснением.

EDIT: длинная версия:

Проблема с вашим запросом заключается в том, что анализатор объединен с фильтром term в вашем запросе. Ваш анализатор разбивает текст поля firstName на токены; поэтому "Test 3" становится токенами "test" и "3". Когда вы используете { "term": { "seller.firstName": "Test 3" } } то, что вы говорите, найдите документ, где один из токенов для "seller.firstName" является "Test 3", и нет никаких документов, для которых это верно (на самом деле, не может быть указано, как ваш анализатор настроен). Вы можете использовать "index": "not_analyzed" в этом поле, и тогда ваш запрос будет работать, или вы можете использовать фильтр terms, как я показал выше. Вот как я туда попал:

Я начал с определения индекса, на которое вы ссылались в своем комментарии, и немного упростил его, чтобы сделать его более читабельным и при этом сохранить основную проблему:

curl -XDELETE "http://localhost:9200/my_index"

curl -XPUT "http://localhost:9200/my_index" -d'
{
   "settings": {
      "number_of_shards": 1,
      "number_of_replicas": 0,
      "analysis": {
         "filter": {
            "snowball": { "type": "snowball", "language": "English" },
            "english_stemmer": { "type": "stemmer", "language": "english" },
            "english_possessive_stemmer": { "type": "stemmer", "language": "possessive_english" },
            "stopwords": { "type": "stop",  "stopwords": [ "_english_" ] },
            "worddelimiter": { "type": "word_delimiter" }
         },
         "tokenizer": {
            "nGram": { "type": "nGram", "min_gram": 3, "max_gram": 20 }
         },
         "analyzer": {
            "custom_analyzer": {
               "type": "custom",
               "tokenizer": "nGram",
               "filter": [
                  "stopwords",
                  "asciifolding",
                  "lowercase",
                  "snowball",
                  "english_stemmer",
                  "english_possessive_stemmer",
                  "worddelimiter"
               ]
            },
            "custom_search_analyzer": {
               "type": "custom",
               "tokenizer": "standard",
               "filter": [
                  "stopwords",
                  "asciifolding",
                  "lowercase",
                  "snowball",
                  "english_stemmer",
                  "english_possessive_stemmer",
                  "worddelimiter"
               ]
            }
         }
      }
   },
   "mappings": {
      "posts": {
         "properties": {
            "title": {
               "type": "string",
               "analyzer": "custom_analyzer",
               "boost": 5
            },
            "seller": {
               "type": "nested",
               "properties": {
                  "firstName": {
                     "type": "string",
                     "analyzer": "custom_analyzer",
                     "boost": 3
                  }
               }
            }
         }
      }
   }
}'

Затем я добавил несколько тестовых документов:

curl -XPUT "http://localhost:9200/my_index/posts/1" -d'
{"title": "post", "seller": {"firstName":"Test 1"}}'
curl -XPUT "http://localhost:9200/my_index/posts/2" -d'
{"title": "post", "seller": {"firstName":"Test 2"}}'
curl -XPUT "http://localhost:9200/my_index/posts/3" -d'
{"title": "post", "seller": {"firstName":"Test 3"}}'

Затем запустите упрощенную версию вашего запроса с неповрежденной базовой структурой, но с фильтром terms вместо фильтра term:

curl -XPOST "http://localhost:9200/my_index/_search?search_type=dfs_query_then_fetch" -d'
{
   "query": {
      "filtered": {
         "query": {
            "bool": {
               "must": [
                  {
                     "match": {
                        "title": "post"
                     }
                  }
               ]
            }
         },
         "filter": {
            "bool": {
               "must": [
                  {
                     "nested": {
                        "path": "seller",
                        "filter": {
                           "bool": {
                              "must": [
                                 {
                                    "terms": {
                                       "seller.firstName": [
                                          "test",
                                          "3"
                                       ],
                                       "execution": "and"
                                    }
                                 }
                              ]
                           }
                        }
                     }
                  }
               ]
            }
         }
      }
   }
}'
...
{
   "took": 5,
   "timed_out": false,
   "_shards": {
      "total": 1,
      "successful": 1,
      "failed": 0
   },
   "hits": {
      "total": 1,
      "max_score": 6.085842,
      "hits": [
         {
            "_index": "my_index",
            "_type": "posts",
            "_id": "3",
            "_score": 6.085842,
            "_source": {
               "title": "post",
               "seller": {
                  "firstName": "Test 3"
               }
            }
         }
      ]
   }
}

который, кажется, возвращает то, что вы хотите.

Вот код, который я использовал:

http://sense.qbox.io/gist/041dd929106d27ea606f48ce1f86076c52faec91

person Sloan Ahrens    schedule 05.01.2015
comment
Отлично, это работает, но ES не должен делать это для меня? как я могу указать анализатор для использования в фильтре? потому что, если мне придется делать анализ текста поиска, мне может быть довольно сложно - person bitgandtter; 06.01.2015
comment
Прочтите только что сделанное мной редактирование и посмотрите, отвечает ли оно на ваш вопрос. Если нет, я посмотрю, смогу ли я обновить его. Я предполагаю, что вы захотите модифицировать свой анализатор и/или использовать multi_field. - person Sloan Ahrens; 06.01.2015
comment
Спасибо, Слоан, после того, как вы опубликовали ответ, я понял, что custom_analyzer разделяет поле, но я хочу, чтобы он использовал custom_search_analyzer в запросе, поэтому в момент использования фильтров ES разделяет текст для себя, поэтому я не нужно разделить его самостоятельно и построить запрос таким образом. У меня есть другой запрос с multi_match: {query: post, fields: [title, description], Analyzer: custom_search_analyzer}, и я хочу сделать что-то подобное - person bitgandtter; 06.01.2015
comment
Извините, я не уверен, что понимаю ваш вопрос. Вы пробовали то, что предлагаете? Может быть, стоит задать еще один вопрос StackOverflow по этому поводу? - person Sloan Ahrens; 06.01.2015
comment
Да, я пытаюсь, но получаю сообщение об ошибке, потому что не могу найти способ заставить фильтры использовать пользовательский анализатор. попробую с другим вопросом. Спасибо - person bitgandtter; 06.01.2015