ProMem: iterative self-questioning to recover missing facts and cut downstream errors

January 8, 20267 min

Overview

Decision SnapshotNeeds Validation

The method shows clear empirical gains on two benchmarks and ablations, but adds token and latency cost and depends on backbone LLM quality.

Citations0

Evidence Strength0.60

Confidence0.87

Risk Signals9

Trust Signals

Findings with numeric evidence: 5/5

Findings with evidence refs: 5/5

Results with explicit delta: 6/6

Reproducibility

Status: Partial assets available

Open source: Unknown

At A Glance

Cost impact: 50%

Production readiness: 60%

Novelty: 60%

Authors

Chengyuan Yang, Zequn Sun, Wei Wei, Wei Hu

Links

Abstract / PDF / Data

Why It Matters For Business

Improving what an agent saves (more complete, grounded memories) raises answer quality and reduces long-term error costs; pay once for extraction, benefit many reads.

Who Should Care

Summary TLDR

The paper introduces ProMem, an iterative memory-extraction pipeline for LLM agents that adds a feedback loop of semantic alignment and self-questioning to the usual one-shot summarization. On HaluMem and LongMemEval, ProMem raises memory recall (integrity) from ~41% (typical baselines) to 73.8% and boosts downstream QA (62.26% on HaluMem, 69.57% on LongMemEval). ProMem is robust to heavy token compression and can run with smaller LLMs (Llama3-8B) to reduce cost.

Problem Statement

Current agent memory systems compress dialogues in a single summarization pass. That 'ahead-of-time' and 'one-off' extraction misses small but important facts and locks in hallucinations. The result: incomplete or incorrect stored memories reduce accuracy on later queries.

Main Contribution

Propose ProMem: make extraction iterative with semantic alignment and self-questioning verification.

Show large gains in memory completeness and downstream QA on HaluMem and LongMemEval.

Key Findings

ProMem raises memory integrity on HaluMem to 73.80%, outperforming common summary baselines.

NumbersMemory Integrity: ProMem 73.80% vs Mem0/Supermemory ~42%

Practical UseUse iterative extraction to recover most missed facts; expect ~+30pp recall versus one-pass summarizers on HaluMem-style data.

Evidence RefTable 1; Sec.4.2

Downstream QA accuracy improves: ProMem gets 62.26% on HaluMem and 69.57% on LongMemEval.

NumbersQA Accuracy: 62.26% (HaluMem), 69.57% (LongMemEval)

Practical UseHigher extraction completeness translates to better answers; invest tokens in extraction if QA matters.

Evidence RefTable 1; Sec.4.6

Results

MetricValueBaselineDeltaSplit / DatasetEvidenceEvidence Ref
Memory Integrity73.80%Mem0 / Supermemory ~42%+31.0ppHaluMemTable 1 reports ProMem 73.80% vs Mem0 42.91% and Supermemory 41.53%Table 1; Sec.4.2
Accuracy89.47%Memobase 92.24%-2.77ppHaluMemTable 1 shows ProMem 89.47% versus Memobase 92.24%Table 1; Sec.4.2

What To Try In 7 Days

Add a semantic-match step to map summaries back to dialogue turns and re-extract uncovered turns.

Implement a self-questioning loop: generate verification questions for extracted facts and validate against raw turns.

Run a compressed-input test: drop tokens and compare QA before/after adding ProMem steps.

Agent Features

Memory
proactive extractionsemantic matching to turnsrecurrent verification loop
Tool Use
embedding-based retrievalself-questioning (auto-generated probes)
Frameworks
ProMem
Is Agentic

Yes

Architectures
LLM-based agent

Optimization Features

Token Efficiency
robust to heavy token drop (tested to 0.2)write-once, read-many tradeoff reduces amortized cost
Inference Optimization
use SLMs for verification stepsapply token compression before extraction

Reproducibility

Code AvailableNo
Data AvailableYes
Open Source StatusUnknown
LicenseUnknown

Data URLs

HaluMem (Chen et al., 2025)LongMemEval (Wu et al., 2025)

Risks & Boundaries

Limitations

Higher token and latency cost from iterative verification.

Effectiveness depends on backbone LLM reasoning quality.

When Not To Use

Hard real-time systems that cannot tolerate extra extraction latency.

Very small/weaker LMs that cannot generate reliable verification questions.

Failure Modes

Backbone LLM hallucinations produce incorrect verification Q/A and corrupt memory.

High token cost if extraction is repeated without amortization.

Core Entities

Models

GPT-4o-miniGPT-4oLlama3-8BQwen3-Embedding-8B

Metrics

Memory IntegrityAccuracy

Datasets

HaluMemLongMemEval

Benchmarks

HaluMemLongMemEval

Context Entities

Models

Mem0LightMemMemobaseSupermemoryNativeRAG