Pıer
TidesCurrentsHarbor LightsLabBottlesAshore
Pıer

Navigation

  • Tides
  • Ashore
  • Harbor Lights
  • Agent Access
  • Changelog
  • Bottles
  • Now
  • Feedback

External links

GitHubCloudborne ↗

© 2026 Pier.

WatchingResearchWatching0 independent reports0

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

First seen · 8/6/2026, 01:41 AMLatest activity · 8/6/2026, 01:41 AM

The paper introduces Answer-Backtracked Credit Assignment (ABC), which traces a ground-truth answer backward to recover intermediate clues and scores each search step against those clues. The resulting dense supervision is used in ABC-SFT for turn-level loss reweighting and ABC-GRPO for step-level rewards. An ABSeeker model trained from Qwen3.5-4B on only 8.5k examples reaches 37.3% on BrowseComp and 39.1% on BrowseComp-ZH. With context management, performance rises to 55.3% and 52.9%, respectively, reportedly matching some much larger, approximately 30B-scale agents.

Event heat · last 24 hours

No heat snapshots are available in the last 24 hours.

No heat snapshots are available in the last 24 hours.

Reporting Timeline

  1. AggregatorHuggingFace Daily Papers8/5, 04:00 AMnot independent
    ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
  2. AggregatorarXiv8/6, 01:41 AMnot independentRepresentative
    ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment