I maintain Agent Brain Hub , an open-source memory layer that several AI agents share. Last release I added real embedding models, and recall on my benchmark went from 88.5% to 100%. Then I wrote a harder test, and the model fell over on something any keyword search gets right. The failure A customer has twelve shopping conversations, one per order: My order ORD-48200 for a blue backpack hasn't arrived yet My order ORD-48201 for running shoes hasn't arrived yet … My orde...