|
| 1 | +from memos.api.handlers.base_handler import HandlerDependencies |
| 2 | +from memos.api.handlers.search_handler import SearchHandler |
| 3 | + |
| 4 | + |
| 5 | +class BatchLimitedEmbedder: |
| 6 | + def __init__(self, *, limit: int): |
| 7 | + self.limit = limit |
| 8 | + self.calls: list[list[str]] = [] |
| 9 | + |
| 10 | + def embed(self, texts: list[str]) -> list[list[float]]: |
| 11 | + self.calls.append(list(texts)) |
| 12 | + if len(texts) > self.limit: |
| 13 | + raise AssertionError(f"batch too large: {len(texts)}") |
| 14 | + return [[float(len(text)), 0.0] for text in texts] |
| 15 | + |
| 16 | + |
| 17 | +def _handler(embedder: BatchLimitedEmbedder) -> SearchHandler: |
| 18 | + searcher = type("FakeSearcher", (), {"embedder": embedder})() |
| 19 | + return SearchHandler( |
| 20 | + HandlerDependencies( |
| 21 | + naive_mem_cube=object(), |
| 22 | + mem_scheduler=object(), |
| 23 | + searcher=searcher, |
| 24 | + deepsearch_agent=object(), |
| 25 | + ) |
| 26 | + ) |
| 27 | + |
| 28 | + |
| 29 | +def test_extract_embeddings_batches_missing_documents(): |
| 30 | + embedder = BatchLimitedEmbedder(limit=10) |
| 31 | + handler = _handler(embedder) |
| 32 | + memories = [ |
| 33 | + {"memory": f"memory {idx}", "metadata": {}} |
| 34 | + for idx in range(25) |
| 35 | + ] |
| 36 | + |
| 37 | + embeddings = handler._extract_embeddings(memories) |
| 38 | + |
| 39 | + assert [len(call) for call in embedder.calls] == [10, 10, 5] |
| 40 | + assert len(embeddings) == 25 |
| 41 | + assert all(mem["metadata"]["embedding"] for mem in memories) |
0 commit comments