context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

text_extraction_methods_comprehensive_20260307_deep_research

Z3 全文↑ Z2 条目

方法论库 · 引用级 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/text_extraction_methods_comprehensive_20260307_deep_research.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/text_extraction_methods_comprehensive_20260307_deep_research.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: text_extraction_methods_comprehensive_20260307_deep_research
description: 文本提取/摘要方法综述
domain: infra
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

Text Extraction and Summarization Methods

This document provides an overview of various methods for text extraction and summarization, covering embeddings, semantic representation, traditional NLP methods, deep learning approaches, and evaluation metrics.


1. Embeddings for Text Extraction

Vector Representations

Embeddings are vectors that represent data in a continuous space. In NLP, embeddings typically represent words, phrases, or sentences, allowing them to be processed mathematically. The key advantage is that semantically similar items are positioned close to each other in the embedding space.

Sentence Embeddings

Sentence embeddings capture the meaning of entire sentences as dense vectors. Popular approaches include:

Dense Retrievers

Dense retrievers use neural networks to encode queries and documents into dense vector representations:

Key advantage: Unlike sparse methods (like TF-IDF), dense retrievers can capture semantic relationships beyond exact word matches.


2. Semantic Representation

Knowledge Graphs

Knowledge graphs represent structured information as entities and relationships:

Semantic Parsing

Semantic parsing converts natural language into structured representations:

Entity Extraction


3. Traditional NLP Methods

TF-IDF (Term Frequency-Inverse Document Frequency)

A classic approach for text representation and retrieval:

BM25 (Best Matching 25)

An improved ranking function that addresses TF-IDF limitations:

Extractive Summarization

Selects important sentences/phrases from the original text:

Keyword Extraction

Identifies the most important terms in a document:


4. Deep Learning Methods

Seq2Seq Models

Sequence-to-sequence models revolutionized NLP tasks:

Attention Mechanisms

Attention allows models to focus on relevant parts of the input:

Transformer Networks

Transformers rely on self-attention mechanisms rather than recurrence:

Modern Summarization Approaches


5. Evaluation Methods

ROUGE (Recall-Oriented Understudy for Gisting Evaluation)

BLEU (Bilingual Evaluation Understudy)

BERTScore

Human Evaluation

Metric Comparison

MetricStrengthsWeaknesses
ROUGESimple, fastNo semantics, exact match
BLEUStandard for MTPenalizes paraphrases
BERTScoreSemantic understandingComputationally heavier
HumanComprehensiveExpensive, slow

References


Last updated: 2025-03-05


6. Latest Research Updates (March 2026)

6.1 MAMBA-Transformer Hybrids for Extractive Summarization

Key Paper: "Efficient Extractive Summarization with MAMBA-Transformer Hybrids for Low-Resource Scenarios" (arXiv:2603.01288, March 2026)

This represents the first hybrid Transformer-State Space Model (SSM) architecture for extractive summarization:

6.2 Hybrid Search: BM25 + Vector Retrieval

The consensus in 2025-2026 is that hybrid retrieval combining BM25 with semantic search outperforms either approach alone:

BM25 Strengths:

Hybrid Patterns:

  1. Full-text as primary retriever → Works well for keyword-based queries with strong terminology
  2. Full-text as filter for vector search → Narrow candidates with keywords, then rank by semantic similarity
  3. Full-text as backstop → Run vector search, fall back to BM25 if results are poor

Implementation: RRF (Reciprocal Rank Fusion) merges BM25 and vector results. Typical weighting: alpha=0.75 for vector, alpha=0.25 for BM25.

6.3 Knowledge Graph Extraction with LLMs

Recent advances (2025-2026) have revolutionized KG extraction:

KGGen Approach (Feb 2025):

Production Tools:

Key Trend: LLMs have reframed information extraction as a generative task, eliminating the need for training specialized NER and RE models.

6.4 RAG Evaluation Metrics: RAGAs and Faithfulness

RAGAs (RAG Assessment) has become the standard framework for RAG pipeline evaluation:

Key Metrics:

Implementation:

G-Eval: LLM-based evaluation framework using chain-of-thought prompting for summarization quality assessment.

6.5 MTEB and Sentence Transformer Ecosystem

Massive Text Embeddings Benchmark (MTEB) continues to drive embedding model advances:

Popular Models:


Section 6 added: March 5, 2026


7. Advanced Embedding Architectures (March 2026)

7.1 Bi-encoders vs Cross-encoders vs Late Interaction

The 2026 retrieval landscape emphasizes multi-stage retrieval pipelines combining different encoder architectures:

Bi-encoders (Siamese Networks):

Cross-encoders:

Late Interaction Models (ColBERTv2):

2026 Best Practice Pipeline:

  1. BM25/sparse retrieval → candidate set
  2. Bi-encoder (e.g., E5-large-v2, Contriever) → initial ranking
  3. Late-interaction model (ColBERTv2) → refined ranking
  4. Cross-encoder (monoT5) → final reranking
  5. LLM (72B Qwen 2.5 Instruct) → listwise refinement

7.2 Late Chunking and Context-Aware Embeddings

Late Chunking (Jina AI, advanced in 2025-2026):

Context-Aware Embeddings (Anthropic, 2025):

Perplexity pplx-embed (February 2026):

7.3 Matryoshka Representation Learning (MRL)

MRL enables flexible dimension trade-offs without retraining:

Key Concept:

2026 Advances:

Performance at 64 dimensions:

7.4 Instruction-Aware Embeddings

Qwen3 Embeddings (2026):

Voyage AI:


8. Sparse + Dense Hybrid Retrieval (March 2026)

8.1 BGE-M3 and Multi-Vector Retrieval

BGE-M3 (BAAI):

Architecture Benefits:

8.2 Learned Sparse Embeddings

Beyond traditional BM25:


9. Chunking Strategies (March 2026)

9.1 Token Overlap Strategies

2026 Consensus:

9.2 Query-Dependent Chunking

AI21 Labs (2026):

9.3 Hierarchical/Graph-Based Chunking

RAPTOR (2025):

Graph-Based:


10. New Evaluation Methods Beyond ROUGE/BERTScore (March 2026)

10.1 LLM-as-a-Judge

Framework:

Advantages over lexical metrics:

Best Practices (2026):

10.2 G-Eval

G-Eval (2024-2025):

10.3 RAG Evaluation: RAGAs, ARES, TruLens

RAGAs (RAG Assessment):

ARES (Automated RAG Evaluation System):

TruLens:

10.4 Factual Consistency Metrics

QAFactEval:

GloSA-sum (February 2026):

10.5 SummQ: Quiz-Based Evaluation

SummQ Framework (September 2025):

10.6 Self-BLEU and Diversity Metrics

For multi-candidate generation:


11. CPU-Optimized Embeddings (2026)

11.1 Cost Reduction Techniques

2026 Focus: Reducing embedding inference costs:

Key Approaches:

Benchmark Results:

11.2 Local Embedding Options

Popular Local Models:


12. Emerging Techniques (March 2026)

12.1 HippoRAG-v2

Memory-aware retrieval:

12.2 GraphRAG Integration

Knowledge Graph + RAG:

12.3 Multimodal Embeddings

Amazon Nova Multimodal Embeddings:

12.4 Generative Embeddings

Let LLMs Speak Embedding Languages (arXiv:2509.24291):


References (Updated March 2026)


13. Lightweight NER and Relation Extraction (2025-2026)

13.1 GLiNER - Generalist Lightweight NER

Paper: NAACL 2024, arXiv:2311.08526 | GitHub: https://github.com/urchade/GLiNER

GLiNER represents a breakthrough in lightweight named entity recognition:

2025 Update - GLiNER2 (arXiv:2507.18546):

13.2 GLiREL - Zero-Shot Relation Extraction

GitHub: https://github.com/jackboyla/GLiREL | Paper: arXiv:2501.03172

13.3 Relik - Entity Linking and Relationship Extraction

Reference: Neo4j Developer Blog (August 2025) - https://neo4j.com/blog/developer/entity-linking-relationship-extraction-relik-llamaindex/

13.4 Reamend - LLM Augmented Joint Learning

Paper: Information Sciences, October 2025 - https://www.sciencedirect.com/science/article/abs/pii/S1568494625014073

13.5 ZERONER - Advanced Zero-Shot NER

Paper: ACL Findings 2025 - https://aclanthology.org/2025.findings-acl.805/


14. Transformer Summarization: Comparative Analysis (2025)

14.1 PEGASUS, BART, T5 Comparative Study

Paper: MDPI Future Internet, August 2025 - https://www.mdpi.com/1999-5903/17/9/389

ModelStrengthsWeaknessesBest For
PEGASUSGap-sentence generation pre-trainingLarger model sizeNews articles, structured documents
BARTPre-trained for denoising/summarizationSlower inferenceGeneral summarization
T5Flexible, text-to-text frameworkRequires "summarize:" prefixMulti-task scenarios

Key Findings (2025):

14.2 Fine-tuning Considerations


15. Long-Context LLM Summarization (2025-2026)

15.1 Million-Token Context Models

Benchmark: InfiniteBench (Zhang et al., 2024) - tasks on 100K+ tokens

Leading Models (2026):

ModelContext WindowUse Case
GPT-4o1M tokensLong document analysis
Claude 4200K+ tokensExtended reasoning
Llama 4 Scout10M tokensFull-book summarization
Gemini 2.01M+ tokensMulti-modal long context

15.2 Context Rot Phenomenon

Reference: Chroma Research - https://research.trychroma.com/context-rot

15.3 Summarization Strategies for Long Documents

  1. Hierarchical approach: Summarize sections, then summarize summaries
  2. Sliding window with memory: Keep running summary of processed content
  3. Retrieval-based: Extract relevant passages before summarization
  4. LLM-based agents: Multi-step reasoning over long documents

16. Advanced Embedding Models (2025-2026)

16.1 GritLM - Generation-Retrieval Interleaving

Reference: https://research.aimultiple.com/open-source-embedding-models/

16.2 E5 Embedding Family

Performance Comparison:

16.3 BGE-M3 Multilingual Leadership

Reference: https://dasroot.net/posts/2026/01/embedding-models-comparison-bge-e5-instructor/


References (Additional)


17. METEOR Metric (Extended)

17.1 Overview

METEOR (Metric for Evaluation of Translation with Explicit ORdering) was developed by IBM to address limitations in BLEU, particularly for tasks requiring paraphrase awareness.

Design Philosophy:

17.2 How METEOR Works

Scoring Process:

  1. Alignment: Align candidate and reference sentences using exact matches, stemmed matches, and synonym matches
  2. Fragmentation Penalty: Penalize fragmented/misaligned translations
  3. Score Calculation: Harmonic mean of precision and recall with fragmentation penalty

Key Features:

17.3 Comparison with Other Metrics

FeatureBLEUMETEORROUGEBERTScore
Exact matches
Synonyms
Stemming
Semantic similarity
Recall-oriented

17.4 Applications and Limitations

Use Cases:

Limitations:


18. Topic Modeling: LDA and NMF

18.1 Latent Dirichlet Allocation (LDA)

LDA is a generative probabilistic model that discovers abstract topics in a collection of documents.

How LDA Works:

  1. Each document is a mixture of topics
  2. Each topic is a distribution over words
  3. The model infers these distributions from the text

Mathematical Framework:

Practical Applications in Extraction:

Strengths:

Limitations:

18.2 Non-Negative Matrix Factorization (NMF)

NMF is a non-probabilistic matrix decomposition technique for topic modeling.

How NMF Works:

  1. Decompose document-term matrix into two non-negative matrices: W (document-topic) and H (topic-term)
  2. Optimize reconstruction error: ||V - WH||²

Key Properties:

Comparison with LDA (from Nature Scientific Reports, 2024):

AspectLDANMF
TypeProbabilisticMatrix factorization
OutputTopic-word probabilitiesTopic-word weights
InterpretabilityGoodOften better (parts-based)
Short textsWeakerStronger
ScalabilityGoodGood

18.3 Modern Topic Modeling (2024-2025)

BERTopic:

Top2Vec:

Selection Guide (2025):


19. Pyramid Method for Summarization Evaluation

19.1 Overview

The Pyramid method (Nenkova et al., 2007) addresses limitations of purely automatic metrics by incorporating human-created content units.

Core Idea:

19.2 Implementation

Step-by-Step Process:

  1. CU Extraction: Multiple annotators read source and extract factual statements
  2. Weighting: CUs appearing in multiple annotations get higher weights
  3. Scoring: Count weighted CUs present in candidate summary
  4. Normalization: Divide by total possible CUs

Pyramid Score:

Pyramid Score = (Sum of weights of covered CUs) / (Sum of weights of all CUs in reference)

19.3 Advantages and Limitations

Advantages:

Limitations:

19.4 Modern Usage

Current Status (2025-2026):

Practical Application:


20. Complete Evaluation Method Comparison

20.1 Summary Table

MetricBest ForLimitationsAutomatic
ROUGE-NContent overlap, recallExact match only
ROUGE-LSequence matchingIgnores gaps
BLEUMT, exact fluencyPenalizes paraphrasing
METEORParaphrase qualityWordNet dependency
BERTScoreSemantic similarityComputational cost
RAGAsRAG pipelinesLLM dependency
PyramidGold-standard coverageHuman effort requiredPartial
Human EvalAll aspectsTime, cost, subjectivity

20.2 2026 Best Practice

Recommended Evaluation Pipeline:

  1. Automatic metrics (fast iteration): ROUGE + BERTScore
  2. Semantic metrics (paraphrase-aware): METEOR or BERTScore
  3. RAG-specific (if applicable): RAGAs framework
  4. Gold standard (critical tasks): Pyramid or human evaluation
  5. LLM-based (modern approach): G-Eval for comprehensive quality

Sections 17-20 added: March 5, 2026


21. Pointer-Generator Networks and Coverage Mechanism

21.1 Overview

Pointer-Generator Networks (PGN), introduced by See et al. (2017) in "Get To The Point: Summarization with Pointer-Generator Networks", combine the benefits of extractive and abstractive summarization.

Key Paper: arXiv:1704.04368

21.2 Architecture

The PGN has three main components:

  1. Sequence-to-Sequence Attention Model:
  1. Pointer Mechanism:
  1. Coverage Mechanism:

21.3 How It Works

Generation vs. Pointing:

Coverage Loss:

coverage_loss = Σ min(attention_i, coverage_i)

21.4 Modern Usage (2024-2025)

Transformer + PGN Hybrids (2025):

Strengths:

Limitations:


22. SummaC: Summary Consistency Detection

22.1 Overview

SummaC (Summary Consistency) is a metric for evaluating factual consistency between summaries and source documents. Published in TACL 2022, it addresses the critical issue of hallucination in summarization.

Key Paper: arXiv:2111.09525 | ACL Anthology: 2022.tacl-1.10

22.2 Methodology

SummaC uses Natural Language Inference (NLI) to detect inconsistencies:

  1. Sentence-Level Consistency:
  1. NLI Models Used:
  1. Aggregation:

22.3 SummaC Benchmark

Six datasets in the benchmark:

Evaluation: Binary classification (consistent vs. inconsistent)

22.4 Performance

SummaCConv Results:

22.5 Comparison with Other Factual Consistency Metrics

MetricApproachStrengthsLimitations
SummaCNLI-basedNo training needed on summary data, interpretableMay miss subtle inconsistencies
QAFactEvalQuestion generation + answeringCaptures fine-grained factsRequires QA model
BERTScoreSemantic similarityFast, captures meaningDoesn't specifically detect contradiction
FactCCentailment-basedSpecialized for factual checkingRequires training data

22.6 Practical Implementation

Using SummaC:

from summac.model_summac import SummaCConv

# Load model
model = SummaCConv(verbs="exec", max_chunk=512)

# Score summary against source
score = model.score(source_doc, generated_summary)
# Returns consistency score (0-1)

Best Practices (2025-2026):


23. Latest Research Updates (March 2026 - Week 1)

23.1 Embeddings - Newest Models and MTEB Updates

Perplexity pplx-embed (Released March 2026)

Qwen3-Embedding-8B (March 2026)

PTEB: Stochastic Paraphrasing for Embedding Evaluation (arXiv:2510.06730, February 2026)

Legal RAG Bench (March 2026)

23.2 Semantic Representation - Knowledge Graphs and RAG Advances

GraphRAG (March 2026)

Enterprise RAG Adoption (Gartner Survey, March 2026)

Knowledge Graph Conference 2026 (March 2026)

23.3 Traditional NLP - Classical Approaches

BM25 Renaissance (March 2026)

spaCy and Classical NLP Libraries

23.4 Deep Learning - Transformer Variants, SSMs, Summarization

MAMBA-Transformer Hybrids (arXiv:2603.01288, March 2026)

Mamba for NLP (March 2026)

Qwen3.5 and DeepSeek V4 (March 2026)

23.5 Evaluation Methods - Latest Metrics, LLM-as-Judge

LLM-as-Judge Evolution (March 2026)

RAG Evaluation Best Practices (March 2026)

RAGAs Framework Updates (2026)

RAGChecker (March 2026)

SEAL LLM Leaderboards (Scale AI, March 2026)

G-Eval and SummQ (2025-2026)


Section 23 added: March 6, 2026


24. Classical Word Embeddings (Foundation)

24.1 Word2Vec

Overview: Introduced by Mikolov et al. (2013) at Google, Word2Vec revolutionized NLP by learning dense vector representations for words from large unlabeled corpora.

Architecture Variants:

Key Characteristics:

Limitations:

2024-2025 Usage: Still used as baselines and for efficient token-level features, but largely superseded by contextual embeddings for most tasks.

24.2 GloVe (Global Vectors)

Paper: Pennington et al. (2014) - "GloVe: Global Vectors for Word Representation"

Approach: Combines global matrix factorization with local context window methods:

Advantages over Word2Vec:

Limitations:

2024-2025 Usage: Used in embeddings ensembles and when interpretable co-occurrence features are needed.

24.3 FastText

Paper: Bojanowski et al. (2017) - "Enriching Word Vectors with Subword Information"

Key Innovation: Uses subword (character n-gram) representations:

Advantages:

Limitations:

2024-2025 Usage:

24.4 Comparison Summary

FeatureWord2VecGloVeFastText
TrainingPredictingMatrix factorizationPredicting with subwords
OOV Handling
Subword Info
SpeedFastMediumMedium
ContextLocalGlobal + LocalLocal
2025 StatusLegacyLegacyLegacy/Foundation

24.5 Evolution to Contextual Embeddings

The key limitation of all classical embeddings: static - same word always has same vector regardless of context.

Modern Solution - Contextual Embeddings:

Key Advantage: Same word gets different embedding based on context ("bank" = river vs. financial institution)


25. Advanced Traditional NLP Methods

25.1 Part-of-Speech (POS) Tagging

Definition: Assigns grammatical tags to each word (noun, verb, adjective, etc.)

Methods:

  1. Rule-based: Dictionary lookup + contextual rules
  2. Statistical: HMM (Hidden Markov Model), CRF (Conditional Random Fields)
  3. Neural: BiLSTM-CRF, Transformer-based taggers

2024-2025 State:

Applications in Text Extraction:

25.2 Dependency Parsing

Definition: Analyzes grammatical structure by establishing relationships between words (subject, object, modifier, etc.)

Popular Parsers:

2024-2025 Advances:

Applications:

25.3 Coreference Resolution

Definition: Determining which mentions in text refer to the same entity

Challenges:

2024-2025 Methods:

Neural Approaches:

LLM-Enhanced (2025):

Tools:

Applications in Extraction:

25.4 Practical Pipeline Integration

Modern Extractive Pipeline (2025):

Raw Text → Sentence Split → Tokenize → POS Tag → Dependency Parse → NER → Coreference → Relation Extraction

Python Libraries:


26. Semantic Similarity Methods

26.1 Traditional Approaches

Word Overlap Metrics:

Limitations:

26.2 Embedding-Based Similarity

Sentence Embeddings (see Section 7):

2025-2026 Best Practices:

26.3 Semantic Similarity Benchmarks

STS (Semantic Textual Similarity):

Benchmarks:

26.4 Cross-Encoder vs Bi-Encoder Similarity

Bi-Encoder (for ranking):

Cross-Encoder (for reranking):


27. Fine-Tuning Strategies for Summarization

27.1 Full Fine-Tuning

Process:

  1. Initialize with pretrained weights
  2. Update all parameters on domain data
  3. Risk: Catastrophic forgetting

Best Practices:

27.2 Parameter-Efficient Fine-Tuning (PEFT)

2024-2025 Dominant Approaches:

LoRA (Low-Rank Adaptation):

Prefix Tuning:

Adapter Modules:

Quantization + PEFT:

27.3 Domain Adaptation

Continued Pretraining:

  1. Continue pretraining on domain corpus (domain-adaptive pretraining)
  2. Then fine-tune on summarization task

Data Selection:

27.4 Multi-Task Fine-Tuning

Approach: Train on multiple related tasks simultaneously

2025 Trend:


28. Note on BLOND Metric

The original task mentioned "BLOND" metric. Based on comprehensive research:

BLOND Status:

Recommendations:

If "BLOND" refers to a specific proprietary metric, please provide additional context.


References (Sections 24-28)


Sections 24-28 added: March 6, 2026


Summary: Complete Coverage

This document now covers all five research angles:

AngleSectionsKey Topics
1. Embeddings1, 7, 8, 9, 16, 23, 24Word2Vec, GloVe, FastText, Sentence embeddings, BERT, MTEB, Late chunking, Matryoshka MRL
2. Semantic Representation2, 6.3, 14, 18, 23, 26Knowledge graphs, topic models (LDA, NMF), semantic similarity, semantic parsing
3. Traditional NLP3, 13, 23, 25TF-IDF, BM25, POS tagging, dependency parsing, NER (GLiNER), coreference resolution
4. Deep Learning4, 6.1, 14, 15, 21, 23, 27Seq2Seq, Transformers, BART, T5, PEGASUS, GPT, fine-tuning (LoRA, QLoRA), Pointer-Generator
5. Evaluation Methods5, 6.4, 10, 17, 19, 20, 22, 23ROUGE, BLEU, METEOR, BERTScore, SummaC, RAGAs, G-Eval, Pyramid, Human evaluation

23. LLM-Based Extraction and Summarization: Advances 2025-2026

This section covers the latest advances in text extraction and summarization using Large Language Models, focusing on developments from 2025-2026.

23.1 LLM-Based Extraction Methods

23.1.1 Generative Information Extraction with LLMs

Recent surveys (Xu et al., 2025) have comprehensively reviewed LLM-based generative IE methods, which convert plain text into structured knowledge through auto-regressive generation rather than traditional discriminative approaches.

Key Paradigms:

Typical IE Tasks Addressed:

23.1.2 In-Context Learning for Extraction

In-context learning (ICL) has emerged as a powerful paradigm for rapid domain adaptation in extraction tasks.

Key Developments (2025):

Best Practices for ICL in Extraction:

23.1.3 Universal IE Frameworks

Two main approaches have emerged for universal information extraction:

  1. NL-LLMs (Natural Language LLM-based): Uses natural language prompts to define extraction schemas
  2. Code-LLMs: Represents extraction tasks as code (e.g., Python classes with docstrings), leveraging LLMs' code generation capabilities

Key Frameworks:

23.2 Long-Context LLMs for Document Summarization

23.2.1 Context Window Advances

State-of-the-art models now support context windows of 16K to 1M+ tokens, dramatically improving their ability to summarize lengthy documents while maintaining coherence.

Key Capabilities:

23.2.2 Summarization Strategies

1. Extractive vs. Abstractive Approaches:

2. Map-Reduce Approaches:
For documents exceeding token limits, MapReduce remains the dominant approach:

3. Chain-of-Thought (CoT) Summarization:

4. Hierarchical/Structured Approaches:

23.2.3 Efficient Context Management

Recent advances in context management for summarization include:

23.3 Evaluation Metrics and Benchmarks (2025-2026)

23.3.1 Traditional Metrics Still in Use
23.3.2 New Evaluation Frameworks

Systematic Reviews (2025):

Benchmark Datasets:

Biomedical Literature Summarization:

23.3.3 LLM-as-Judge Evaluation
23.3.4 Domain-Specific Benchmarks

Key Developments:

23.3.5 RAG-Specific Evaluation

For retrieval-augmented extraction/summarization:

23.3.6 Emerging Evaluation Platforms (2026)
PlatformKey Features
DeepEval30+ metrics, RAG/agentic/conversational evaluation
RAGAsOpen-source framework for RAG pipelines
MLFlowEnterprise LLM benchmarking
Arize AIObservability and evaluation

23.4 Key Research Papers and Resources (2025-2026)

Essential Papers:

  1. "Large Language Models for Generative Information Extraction: A Survey" (Xu et al., arXiv 2025) - Comprehensive survey of LLM-based IE
  2. "CoTHSSum: Structured long-document summarization via chain-of-thought reasoning and hierarchical segmentation" (2025)
  3. "A systematic review of long document summarization methods: Evaluation metrics and approaches" (ScienceDirect, Aug 2025)
  4. "Evaluation of Prompt Engineering on the Performance of a Large Language Model in Document Information Extraction" (MDPI, 2025)

Curated Resources:

23.5 Practical Recommendations

For Extraction Tasks:

  1. Start with few-shot in-context learning for rapid prototyping
  2. Use Code-LLMs for structured schema extraction
  3. Fine-tune with LoRA (rank 8-16) for domain-specific extraction

For Summarization:

  1. Choose extractive for legal/medical contexts requiring exact phrasing
  2. Choose abstractive for readability-focused applications
  3. Use MapReduce for documents exceeding context window
  4. Apply Chain-of-Thought prompting for complex technical content

For Evaluation:

  1. Combine traditional metrics (ROUGE, BLEU) with LLM-as-judge
  2. Use domain-specific benchmarks when available
  3. Implement faithfulness checks for RAG-based systems

Section 23 added: March 2026 - LLM-based extraction and summarization advances


Document complete - All 5 research angles covered with 2024-2026 methods and trends

Latest Research Findings (March 6, 2026 - Morning Update)

LLM-Based Extraction Methods (2026)

Hybrid Extraction + RAG Approaches

Evaluation Benchmarks for Summarization

Fine-Tuning for Extraction (2026 Best Practices)


Morning update added: March 6, 2026


23. Fresh Research Findings (March 6, 2026 - Final Update)

23.1 MAMBA-Transformer Hybrids for Low-Resource Extractive Summarization

Source: arxiv.org/abs/2603.01288 (March 1, 2026)

23.2 Wayin AI - Technical Video to Searchable Notes

Source: ucstrategies.com (March 5, 2026)

23.3 Semantic Search with LLM Embeddings

Source: machinelearningmastery.com (March 2, 2026)

23.4 Vector Databases 2026 - Complete Guide

Source: calmops.com (March 3, 2026)

23.5 Snowflake Intelligence - Hybrid Search Integration

Source: flexera.com (March 3, 2026)

23.6 Cognitive Architectures for AI Agents - Memory Systems

Source: tredence.com (March 4, 2026)

23.7 OpenSearch Semantic Search with Amazon Bedrock Titan

Source: docs.opensearch.org (March 3, 2026)

23.8 LLM Evaluation Beyond BLEU and ROUGE

Source: wandb.ai (March 2, 2026)

23.9 Production RAG System Best Practices

Source: gauraw.com (March 2, 2026)

23.10 Interpretable Text Embeddings Framework

Source: ICLR 2025 (referenced in recent surveys)


Summary of New Findings (March 6, 2026)

FindingSourceKey Contribution
MAMBA-Transformer hybridsarxiv.orgSSM + Transformer for summarization
Video OCR extractionWayin AIMultimodal technical content extraction
Vector DB 2026Calmops.comComplete landscape guide
Hybrid searchSnowflakeNative SQL + vector integration
Memory architecturesTredenceCognitive AI agent design
LLM evaluationWeights & BiasesBeyond BLEU/ROUGE
Production RAGgauraw.comDomain-specific best practices

Section 23 added: March 6, 2026 07:50 GMT+1 - Final research update


24. Latest Embedding Benchmarks and Evaluation (March 2026)

24.1 PTEB: Stochastic Paraphrasing for Embedding Evaluation

Paper: arXiv:2510.06730 (February 2026)

PTEB (Paraphrasing Text Embedding Benchmark) represents a shift from static datasets to dynamic, evaluation-time assessment:

Key Innovation:

Complementary to MTEB:

24.2 MTEB Leaderboard Updates (March 2026)

Top Open-Source Models:

ModelMTEB ScoreKey Features
Qwen3-Embedding-8B70.58Tops multilingual leaderboard, 128K context
Perplexity pplx-embed-4B-Outperforms Anthropic & Voyage on MTEB/ConTEB
text-embedding-3-large0.92OpenAI's latest, proprietary

Key Trends:

24.3 Legal RAG Bench

Source: Isaacus (March 2026)

Key Finding: Information retrieval is the primary driver of legal RAG performance rather than reasoning capabilities.

Implications:

24.4 Commercial Embedding Options (2026)

Top Performers:

Selection Criteria:


25. Emerging Research Directions (March 2026)

25.1 Agentic RAG (A-RAG)

Paper: arXiv:2602.03442 (February 2026)

Key Innovation: Scaling RAG via hierarchical retrieval interfaces rather than single-shot passage retrieval.

Components:

25.2 Multi-Agent Extraction Systems

MA-RAG Framework:

RAGentA System:

25.3 Context Window Management

Context Rot Phenomenon:

Solutions:

25.4 Multimodal Extraction

Wayin AI (March 2026):

Emerging Capability: Bridging "dark data" gap in video content extraction


References (Section 24-25)


Sections 24-25 added: March 6, 2026


Summary: All Research Angles Complete

Research AngleSections CoveredKey Topics
1. Text Embeddings1, 7, 8, 9, 16, 23, 24Word2Vec, GloVe, FastText, Sentence embeddings, BERT, MTEB, Late chunking, Matryoshka MRL, PTEB, Qwen3-Embedding
2. Semantic Representation2, 6.3, 14, 18, 23, 26Knowledge graphs, topic models (LDA, NMF), semantic similarity, semantic parsing, semantic role labeling
3. Traditional NLP3, 13, 23, 25TF-IDF, BM25, TextRank, POS tagging, dependency parsing, NER (GLiNER), GLiREL, Relik
4. Deep Learning4, 6.1, 14, 15, 21, 23, 27Seq2Seq, Transformers, BART, T5, PEGASUS, GPT, fine-tuning (LoRA, QLoRA), Pointer-Generator, MAMBA-Transformer hybrids
5. Evaluation Methods5, 6.4, 10, 17, 19, 20, 22, 23ROUGE, BLEU, METEOR, BERTScore, SummaC, RAGAs, G-Eval, Pyramid, Human evaluation, LLM-as-Judge

Document fully updated: March 6, 2026


26. Supplementary Research Findings (March 6, 2026)

26.1 Classical Word Embeddings - Additional Insights

Word2Vec
GloVe
FastText

26.2 Semantic Representation -补充

Knowledge Graphs
Topic Modeling Updates

26.3 Evaluation Methods -补充

Metric Performance Comparison (2025-2026 Research)
MetricScore RangeBest For
BERTScoreHigher (0.67)Semantic similarity, intricate texts
ROUGEMiddle (0.67)Word-level overlap, recall
METEORMiddle (0.63)Paraphrase quality
BLEULower (0.56)Exact translation matching
Key Insights

References (Supplementary)


Supplementary section added: March 6, 2026


27. Fresh Web Search Findings (March 6, 2026 - Evening)

27.1 Latest Embedding Techniques (Web Search Results)

Nomic Embed Text V2 (2026):

SBERT Long-Text Optimization (June 2025):

Multimodal Embeddings (2025):

2025 Embedding Trends:

27.2 Knowledge Graph Advances (Web Search Results)

GraphRAG Ecosystem (2025-2026):

LLM-Based KG Extraction:

Evaluation Metrics for KGs:

27.3 Evaluation Metrics - Latest Insights (Web Search Results)

Metric Selection Guide (2025):

BERTScore Advantages:

RAG Evaluation:

Medical Summaries Evaluation (December 2025):


References (Section 27 - Web Search)


Section 27 added: March 6, 2026 20:07 GMT+1 - Evening web search findings


Final Summary

This document now provides comprehensive coverage of:

CategoryCoverage
Word EmbeddingsWord2Vec, GloVe, FastText, classical methods
Sentence EmbeddingsBERT, SBERT, Universal Sentence Encoder, modern transformers
Dense RetrievalDPR, EASE-DR, Bi-encoders, Cross-encoders, ColBERT
Knowledge GraphsConstruction, extraction, GraphRAG, LLM-based methods
Semantic RepresentationTopic models (LDA, NMF, BERTopic), semantic parsing
Traditional NLPTF-IDF, BM25, TextRank, POS, dependency parsing
Deep LearningSeq2Seq, Transformers, BART, T5, PEGASUS, fine-tuning
EvaluationROUGE, BLEU, METEOR, BERTScore, SummaC, RAGAs, LLM-as-Judge
Latest Advances (2026)MAMBA-Transformer hybrids, PTEB, Qwen3 embeddings, Agentic RAG

Document complete - Updated March 6, 2026


28. Latest Research Findings (March 7, 2026 - New Update)

Research compiled from web searches on March 7, 2026


1. Embeddings: New Models & LLM-Empowered Approaches

1.1 New Embedding Models (2025-2026)
ModelDeveloperKey FeaturesBenchmark
Qwen3 EmbeddingAlibabaSizes: 0.6B to 32B; multilingual; #1 on MTEB multilingual (70.58 score)MTEB Multilingual
LREM (Large Reasoning Embedding Models)ResearchCombines CoT reasoning with embedding capabilities; addresses hard queriesDense retrieval
ZeroEntropy EmbeddingsIndustryCompetitive with reranker-quality outputsRAG benchmarks
Perplexity pplx-embedPerplexity0.6B and 4B sizes; outperforms Anthropic & Voyage equivalentsMTEB, ConTEB
Nomic Embed v1.5NomicOpen-source alternative; MoE architectureQuality/cost tradeoff
1.2 LLM-Empowered Embeddings
1.3 Interpretable Text Embeddings (2025)
1.4 Reranking Innovations

2. Semantic Representation: KG Methods & Semantic Graphs

2.1 Knowledge Graph Construction with LLMs
SystemDescriptionScale
ATLASAutomated Triple Linking And Schema induction; constructs KGs from corpora900M+ nodes, 5.9B edges
GraphRAGEntity-centric graphs from retrieved passages with community summarizationMulti-hop QA
Practical GraphRAG (2025)Scalable framework for enterprise deploymentCost-efficient at scale
KGGenExtracts knowledge graphs from plain text using language modelsVarious
2.2 KG-Enhanced RAG
2.3 Semantic Graph Methods

3. Traditional NLP: Extractive Methods

3.1 Modern Extractive Approaches
3.2 Graph-Based Ranking (Updated)

4. Deep Learning: Transformer Variants & SSM Hybrids

4.1 State-Space Model (SSM) Hybrids
ModelTypeKey InnovationPerformance
Bamba (IBM)SSM-Transformer hybridCombines Mamba2 SSM with transformer; 8-bit quantization18GB→9GB size; comparable to Llama-3.1 8B
Granite 4.0 (IBM)Mamba-TransformerHybrid design; cryptographically signedEnterprise deployment
HymbaParallel SSM+AttentionAttention and SSM heads operate simultaneously in same layer3x inference throughput; 256k token windows
TransXSSMUnified RoPE hybridUnified rotary position embedding for SSM + attention4% better than Transformer baseline
JambaSSM-Attention hybridProduction hybrid architectureLong-context efficient
4.2 SSM Technical Details
4.3 LLM-Based Extraction (2025-2026)

5. Evaluation: Benchmarks & LLM-as-Judge

5.1 New Benchmarks (2025-2026)
BenchmarkFocusDetails
NewsSummMulti-document summarization317K+ articles, Indian English, 36 newspapers, human-annotated
BASSEAbstractive summary evaluationComplex validation tasks
Biomedical Summarization (2026)62 methods benchmarkedFrequency-based to LLM methods
5W1H ExtractionLLM-as-judge evaluationComprehensive extraction assessment
Legal RAG BenchLegal retrievalReveals data leakage in commercial embeddings
PTEBDynamic embedding evaluationStochastic paraphrasing at evaluation time
5.2 LLM-as-Judge Improvements (2025-2026)
5.3 Cost Analysis (2025)
ModelInput Cost ($/M tokens)Output Cost ($/M tokens)
Claude Sonnet 4.5$3.00$15.00
GPT-4.1$2.00$8.00
Gemini 2.5 Pro$1.25$10.00
5.4 Metric Performance Comparison (2025-2026)
MetricPerformanceBest For
BERTScoreHigher (0.67)Semantic similarity, intricate texts
ROUGEMiddle (0.67)Word-level overlap, recall
METEORMiddle (0.63)Paraphrase quality
BLEULower (0.56)Exact translation matching

Summary: Key 2025-2026 Advances

CategoryMajor AdvanceImpact
EmbeddingsQwen3, LREM, decoder-based contrastive training#1 multilingual MTEB; reasoning-capable
SemanticATLAS KG construction (900M+ nodes), GraphRAGEnterprise-scale knowledge graphs
Deep LearningBamba, Hymba, TransXSSM hybrids3x throughput, 256k context
Traditional NLPMamba-Transformer extractive hybrids24-27% faster inference
EvaluationLLM-as-judge improvements, new benchmarksCost-aware, human-aligned metrics

References (2025-2026)


Section 28 added: March 7, 2026


29. Additional Research Findings (March 7, 2026 - Afternoon)

29.1 New Summarization Paper: Global Structure Awareness

Paper: arXiv:2602.09821 (February 10, 2026)

Title: "Text summarization via global structure awareness"

Key Contribution:

29.2 RAG Evaluation Tools (March 2026)

Top 5 RAG Evaluation Platforms:

ToolKey FeaturesBest For
Maxim AIEnd-to-end evaluation and observabilityEnterprise production
LangSmithLangChain-native tracingLangChain users
Arize PhoenixOpen-source observabilityML teams
RagasResearch-backed metrics frameworkResearch evaluation
DeepEvalPytest-style testingDeveloper testing

Key Metrics Tracked:

29.3 RAG vs Fine-Tuning (2026)

Key Insight (March 2026):

Evaluation Best Practices:

  1. Maintain canonical question set for cross-team comparisons
  2. Rolling sample for production monitoring
  3. Index snapshotting for reproducible evaluations
  4. Automated scoring: retrieval metrics (NDCG, MRR) → generation metrics (BERTScore, ROUGE, RAGAs)

29.4 Clinical RAG Evaluation (March 2026)

Source: Wiley - CPT: Pharmacometrics & Systems Pharmacology (2026)

Framework: Using DeepEval with three metrics:

Application: Evaluating regulatory compliance of drug information and clinical trial protocols

29.5 Research Tools for Text Extraction (2026)

Paperguide AI (March 2026):

Key Trend: AI tools increasingly combining extraction + summarization + writing in unified workflows


References (Section 29)


Section 29 added: March 7, 2026 15:30 GMT+1 - Final afternoon update


30. Final Research Findings (March 7, 2026 - Late Update)

30.1 Embedding Models for RAG (February 2026)

Top 5 Models Ranked (atal upadhyay blog, February 2026):

RankModelKey Strength
1Qwen3-Embedding-8BMTEB multilingual leader (70.58)
2Perplexity pplx-embed-4BOutperforms Anthropic & Voyage
3BGE-M3Multi-vector retrieval
4Voyage AIBest for book data
5Nomic Embed v1.5Open-source alternative

Key Insight: MTEB scores don't tell full story - adversarial test sets like "Liability Trap" reveal failure modes

30.2 Embedding Model Selection Criteria (2026)

Evaluation Dimensions:

Commercial vs Open Source Trade-offs:

30.3 Sparse + Dense Hybrid Search Updates (March 2026)

OpenSearch Neural Sparse Search:

Three-Way Retrieval (IBM Case Study, 2026):

30.4 Production RAG Best Practices (2026)

Orchestration:

Vector Database Selection:

Domain-Specific Models:


Summary: Complete 5-Angle Research Coverage

Research AngleCoverage StatusLatest Sources
1. Embeddings✅ CompleteQwen3, Perplexity pplx-embed, PTEB, MTEB 2026
2. Semantic Representation✅ CompleteGraphRAG, ATLAS KG, knowledge graphs
3. Traditional NLP✅ CompleteBM25, neural sparse, hybrid search
4. Deep Learning✅ CompleteMAMBA-Transformer, Agentic RAG, fine-tuning
5. Evaluation Methods✅ CompleteRAGAs, DeepEval, LLM-as-judge, benchmarks

Section 30 added: March 7, 2026


Document final update: March 7, 2026


31. Subagent Research Findings (March 7, 2026)

1. Embeddings - New Methods & Benchmarks

GIRCSE: Generative Iterative Refinement (September 2025)
New Embedding Models (Early 2026)

Based on practitioner discussions and leaderboards:

Benchmark Updates
Key Trend

MTEB scores don't tell full story - adversarial test sets like "Liability Trap" (Semantic Twins Dataset for RAG Testing) reveal failure modes that benchmark scores miss, particularly for legal/contractual text where "shall" vs "shall not" distinctions matter.

2. Semantic Representation - RAG & Knowledge Graphs

Agentic RAG (2026)
Knowledge Graph RAG
Pipeline RAG Upgrades (Still Relevant)

3. Traditional NLP Methods

No major breakthrough methods in 2025-2026. The focus has shifted to:

4. Deep Learning - Summarization & Agentic Approaches

SummQ: Adversarial Agentic Collaboration (September 2025)
AgenticSum: Clinical Text Summarization (February 2026)
GloSA-sum: Global Structure-Aware Summarization (February 2026)
Mamba-Transformer Hybrids (March 2026)
State Space Models (SSMs) Developments

5. Evaluation Methods

LLM-as-Judge Evolution
Production Evaluation Frameworks (2026)
FrameworkCore Metrics
DeepEvalAnswer relevancy, faithfulness, contextual relevancy/recall/precision
RAGASContext precision, context recall, answer relevance, faithfulness
TruesightDomain-expert-grounded retrieval quality
Patronus AILLM-based statement extraction and classification
Arize PhoenixEmbedding visualization
New Metrics

Summary: Key 2025-2026 Advances

CategoryMajor AdvanceImpact
EmbeddingsGIRCSE, Qwen3-Embedding, PTEBTest-time scaling, multilingual leadership
Semantic RepresentationAgentic RAG, GraphRAG variantsSelf-correcting retrieval, 1000× cost reduction
Traditional NLPBetter chunking, hybrid approachesImproved RAG pipeline quality
Deep LearningSummQ, AgenticSum, Mamba-TransformerAgentic summarization, efficiency gains
EvaluationMulti-layer RAG eval, LLM-as-judgeProduction-ready metrics

Latest Developments (March 7, 2026 - Evening)

Research conducted: March 7, 2026 evening

Summary of Evening Search Findings

Web searches conducted on March 7, 2026 evening confirmed that the document is already comprehensively covering the latest developments. Key findings:

RAG Evaluation (Enterprise Focus)
Knowledge Graph Construction
Summarization Benchmarks
Field Status (March 7, 2026)

The text extraction and summarization field shows strong activity in:

  1. Agentic RAG - Self-correcting retrieval with planning and iteration
  2. Hybrid SSM-Transformer models - Efficiency gains for long documents
  3. LLM-as-Judge evaluation - Production-ready evaluation frameworks
  4. Domain-specific benchmarks - Legal, medical, multilingual focus

No major breakthrough techniques identified beyond those already documented in the March 7, 2026 morning and afternoon updates.


References (Evening Update)


Evening update added: March 7, 2026


32. Final Subagent Research Findings (March 7, 2026 - Late Evening)

Research completed by subagent on March 7, 2026

1. Embedding Models - Latest MTEB Leaders & New Developments

1.1 Commercial Embedding Models (March 2026)

Elastic's New Embedding Models (February 2026):

Openxcell Ranking (March 2026):

Reddit Practitioner Insights (March 2026):

1.2 CPU-Optimized Embeddings (February 2026)

Key Development:

1.3 Benchmark Limitations

"Liability Trap" Adversarial Test Set:

2. Semantic Representation - GraphRAG & Semantic Caching

2.1 GraphRAG Dynamic Improvements (March 2026)

New Development:

IBM Explanation:

2.2 Semantic Caching for RAG (March 2026)

Zero-Waste Agentic RAG (Towards Data Science, March 2026):

Proximity Project (arXiv:2603.03301):

Boring Bot Implementation (March 2026):

Valkey 2026 (AWS, February 2026):

2.3 Industry RAG Survey (March 2026)

Comprehensive Review (IJET Journal, March 2026):

3. Deep Learning - State Space Models & Mamba-3

3.1 Mamba-3 ICLR 2026

ICLR Poster Presentation (March 2026):

Complex-Valued State Spaces:

3.2 Falcon-H1 Series (March 2026)

Architecture:

Hybrid Approach:

3.3 Other SSM Applications

MambaLLM:

CrossLLM-Mamba:

4. Evaluation - New Benchmarks & Metrics

4.1 DRAGOn Benchmark (arXiv:2507.05713)

Published: July 2025 (discovered March 2026)

Key Features:

4.2 Legal RAG Bench (February 2026)

Source: Isaacus (February 20, 2026)

Purpose: Reasoning-intensive benchmark for legal RAG systems

Key Issues Identified:

4.3 Synthetic Data for RAG Evaluation (February 2026)

Red Hat Developer Article:

4.4 New RAG Evaluation Tools (March 2026)

Goodeye Labs Ranking:

  1. Retrieval Relevance Evaluators: Benchmarked against HaluEval
  2. Precision@K and NDCG: For retrieval ranking quality
  3. Integrations: Ragas, DeepEval, Cleanlab evaluation libraries

Deepchecks RAG Evaluation:

4.5 VectifyAI Mafin 2.5 (February 2026)

Announcement: MarkTechPost (February 22, 2026)

Key Achievement:

5. Complete Summary of Research Angles

Research AngleLatest 2026 DevelopmentsKey Sources
1. EmbeddingsElastic models, CPU optimization, Liability Trap adversarial testsOpenxcell, Elastic, Reddit
2. Semantic RepresentationGraphRAG dynamic selection, semantic caching, Proximity LSHTowards Data Science, arXiv
3. Deep LearningMamba-3 (ICLR), Falcon-H1, hybrid SSM-TransformerICLR 2026, Contabo
4. EvaluationDRAGOn, Legal RAG Bench, synthetic data generationarXiv, Isaacus, Red Hat

Final Research Task Completion

Task: Research latest developments in text extraction and summarization methods

Research Focus Areas (as specified):

  1. ✅ Embedding models - Latest MTEB leaders, new models, benchmark limitations
  2. ✅ Semantic representation - GraphRAG developments, knowledge graphs, semantic caching
  3. ✅ Deep learning - Transformer variants, SSMs, agentic RAG innovations
  4. ✅ Evaluation - New benchmarks, metrics, RAG evaluation frameworks

Time Period: Late 2025 and early 2026

Status: Complete - Document comprehensively updated with latest findings


Subagent research completed: March 7, 2026 20:36 GMT+1


← 返回方法论库索引 · 返回方法论区