org.apache.lucene.analysis
Class LowerCaseTokenizer
- java.lang.Object
-
- org.apache.lucene.analysis.TokenStream
-
- org.apache.lucene.analysis.Tokenizer
-
- org.apache.lucene.analysis.CharTokenizer
-
- org.apache.lucene.analysis.LetterTokenizer
-
- org.apache.lucene.analysis.LowerCaseTokenizer
-
public final class LowerCaseTokenizer extends LetterTokenizer
LowerCaseTokenizer performs the function of LetterTokenizer and LowerCaseFilter together. It divides text at non-letters and converts them to lower case. While it is functionally equivalent to the combination of LetterTokenizer and LowerCaseFilter, there is a performance advantage to doing the two tasks at once, hence this (redundant) implementation.Note: this does a decent job for most European languages, but does a terrible job for some Asian languages, where words are not separated by spaces.
-
-
Constructor Summary
Constructors Constructor and Description LowerCaseTokenizer(java.io.Reader in)Construct a new LowerCaseTokenizer.
-
Method Summary
-
Methods inherited from class org.apache.lucene.analysis.CharTokenizer
next, reset
-
Methods inherited from class org.apache.lucene.analysis.TokenStream
next, reset
-
-
DataMelt 3.0 © DataMelt by jWork.ORG