org.apache.lucene.analysis
Class LetterTokenizer
- java.lang.Object
-
- org.apache.lucene.analysis.TokenStream
-
- org.apache.lucene.analysis.Tokenizer
-
- org.apache.lucene.analysis.CharTokenizer
-
- org.apache.lucene.analysis.LetterTokenizer
-
- Direct Known Subclasses:
- LowerCaseTokenizer
public class LetterTokenizer extends CharTokenizer
A LetterTokenizer is a tokenizer that divides text at non-letters. That's to say, it defines tokens as maximal strings of adjacent letters, as defined by java.lang.Character.isLetter() predicate. Note: this does a decent job for most European languages, but does a terrible job for some Asian languages, where words are not separated by spaces.
-
-
Constructor Summary
Constructors Constructor and Description LetterTokenizer(java.io.Reader in)Construct a new LetterTokenizer.
-
Method Summary
-
Methods inherited from class org.apache.lucene.analysis.CharTokenizer
next, reset
-
Methods inherited from class org.apache.lucene.analysis.TokenStream
next, reset
-
-
DataMelt 3.0 © DataMelt by jWork.ORG