From d1824e4d6eb2ffecd3d13006680e3bed6be9e51f Mon Sep 17 00:00:00 2001 From: Ray Date: Tue, 21 Jul 2026 18:46:15 +0800 Subject: [PATCH] fix: keep the file extension in SDK doc_name, matching legacy and cloud Parsers used path.stem, so the same file was named 'report' in SDK local mode but 'report.pdf' in the legacy path and cloud mode; docs differing only by extension became indistinguishable to the selection agent. --- pageindex/parser/markdown.py | 2 +- pageindex/parser/pdf.py | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/pageindex/parser/markdown.py b/pageindex/parser/markdown.py index 5a80716..4cda0e2 100644 --- a/pageindex/parser/markdown.py +++ b/pageindex/parser/markdown.py @@ -24,7 +24,7 @@ class MarkdownParser: headers = self._extract_headers(lines) nodes = self._build_nodes(headers, lines, model, doc_title=path.stem) - return ParsedDocument(doc_name=path.stem, nodes=nodes, + return ParsedDocument(doc_name=path.name, nodes=nodes, metadata={"line_count": len(lines)}) def _extract_headers(self, lines: list[str]) -> list[dict]: diff --git a/pageindex/parser/pdf.py b/pageindex/parser/pdf.py index ef37a42..e8b9cf5 100644 --- a/pageindex/parser/pdf.py +++ b/pageindex/parser/pdf.py @@ -42,7 +42,7 @@ class PdfParser: images=images, )) - return ParsedDocument(doc_name=path.stem, nodes=nodes, + return ParsedDocument(doc_name=path.name, nodes=nodes, metadata={"page_count": len(reader.pages)}) @staticmethod