{"as_of":"2026-08-21T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18d17504408f92bc6866e2f806812532bf26875c5847b2e3423b4d6e65cd884e","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:34:03.546459Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:51:08.895411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04999","snapshot_observed_at":"2026-07-12T05:51:08.895411Z","title":"Beyond cropped regions: new benchmark and corresponding baseline for chinese scene text retrieval in diverse layouts.arXiv preprint arXiv:2506.04999, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02956","last_updated":"2026-07-03T04:59:12Z","snapshot_observed_at":"2026-08-14T18:47:59.009039Z","submitted_at":"2026-07-03T04:59:12Z","title":"MORE: A Multilingual Document Parsing Benchmark and Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T05:51:08.895411Z"},"links":{"cited_paper":"/paper/2506.04999","citing_paper":"/paper/2607.02956"},"observation_digest":"sha256:50e126bcd06984a68a47fd79966b5f76cc0181c3e2d173b2bf10bc0298c384ee","observation_id":"dad30a42-fba3-4c1c-b7a1-f2edd0a12c4e","resolution":{"observed_at":"2026-07-12T05:51:08.895411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04999/citation-record","integrity":"/paper/2506.04999/integrity","json":"/paper/2506.04999/citation-record.json","paper":"/paper/2506.04999"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.365076Z","title":"Word spotting and recognition with embedded attributes","venue":null,"work_id":"9a29b728-ac6e-430f-95ff-4bc9ce80a9d3","year":2014},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:54.768761Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:cc2a9e3b696f2ec3ddea40bffbd55b0fa796089f141603c5a39d5acb4602c3a5","observation_id":"19b7fbcd-7a0e-47a9-91ed-980b563b0049","resolution":{"observed_at":"2026-08-07T10:34:05.370790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.349146Z","title":"Integrating scene text and visual appearance for fine-grained image classification","venue":null,"work_id":"33e3c9bd-2bd4-4e94-b2c5-36552704ff5e","year":2018},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:54.851730Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:6824eeb9f25f70d45114cd965184f535ac4d33931f523cfee2a7624ff8bfd4e3","observation_id":"8d125acd-11c2-4932-a0cd-de2d8ac1427c","resolution":{"observed_at":"2026-08-07T10:34:05.355245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.333003Z","title":"Composed image retrieval using contrastive learning and task-oriented clip-based features","venue":null,"work_id":"e4f5c97e-2945-47b0-9aa3-15c778116de6","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.023632Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:cdd6f7806a2455c86969642302074a836f267831934b86d0c36e50a9876a05ae","observation_id":"725917d1-32b0-4003-9e5d-048aed65f324","resolution":{"observed_at":"2026-08-07T10:34:05.337860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.317430Z","title":"The devil is in fine-tuning and long-tailed problems: A new benchmark for scene text detection","venue":null,"work_id":"43dcb38f-3caf-4fff-b5ec-5facce729f58","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.221307Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:e254d2ae881168be2fdade8ca33156ac05057fbf8636533226f7da4891518d90","observation_id":"6ab1ddc1-e6d6-446d-bdd9-94d793bc8a99","resolution":{"observed_at":"2026-08-07T10:34:05.322419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.301728Z","title":null,"venue":null,"work_id":"965e61a8-88e4-4573-bf7e-973d443c719c","year":2017},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.383782Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c42731d5c4ad0b37e2bba4b836acadf0d3a6a45e2d14a5443f0e24689c6e7d6d","observation_id":"a9ecefec-40c7-452c-aad5-9d1010d67940","resolution":{"observed_at":"2026-08-07T10:34:05.306842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.284118Z","title":null,"venue":null,"work_id":"853d254f-66eb-40fb-9288-c33615514c3b","year":2015},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.567461Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:0d5f776b6c5b01d60c59fbc559b5be36dfcdf7ec6355490e31ea3d1034241fb9","observation_id":"67c6b5b4-6b3e-42ad-893f-1766c4ca0c3c","resolution":{"observed_at":"2026-08-07T10:34:05.289434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.265014Z","title":"K., Gomez, L., Karatzas, D., and Valveny, E","venue":null,"work_id":"69a08f0f-d498-4b3a-8274-ab4ba6b1bf55","year":2015},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.750412Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:094b2577b20d92e4442109a73d94304c2b3cc200c328dc802c854955ff9d07ce","observation_id":"7326a63d-173c-49bd-aa02-dfb3177080ea","resolution":{"observed_at":"2026-08-07T10:34:05.271142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.249779Z","title":"Lsde: Levenshtein space deep embedding for query-by-string word spotting","venue":null,"work_id":"772f7529-8460-42f2-ba27-65fe67a57bb4","year":2017},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:55.944990Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:daa872798bf9fbf4b3062e7e25117ab8ba6dd9edcc91068bac05259af5d606b1","observation_id":"d77fb228-da44-412e-94e4-46a9daa8bf59","resolution":{"observed_at":"2026-08-07T10:34:05.254671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.234216Z","title":"Single shot scene text retrieval","venue":null,"work_id":"d5bb6d76-9ac3-4fb8-ab92-7459a6cb1d4c","year":2018},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.079254Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:0b77725684711a76f0528b13d3968002bd0f39cb03d87cf76e3042c72ab2f7b7","observation_id":"967183e2-ec4b-478b-b0b5-0e00341d3fc8","resolution":{"observed_at":"2026-08-07T10:34:05.239639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.218497Z","title":"Synthetic data for text localisation in natural images","venue":null,"work_id":"c85d7856-51ad-4340-a7fe-251bea97c58e","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.206032Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b5f300c24594820cb70f5cfeb26301bf962b1d36955d035dfc42e0614e259cbf","observation_id":"9c1f59e1-cfab-4ed4-b07b-eac0c396bfaa","resolution":{"observed_at":"2026-08-07T10:34:05.224142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.200804Z","title":"Bridging the gap between end-to-end and two-step text spotting","venue":null,"work_id":"fa1f5cea-0210-415e-a738-97323241bc25","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.368840Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f8d1d9d54822d4adc6118f6e439014428eec34718361b871e1a390a24c345580","observation_id":"7c64ac95-9dbd-4e08-8110-2a4d52a8a483","resolution":{"observed_at":"2026-08-07T10:34:05.206480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.047598Z","title":"Reading text in the wild with convolutional neural networks","venue":null,"work_id":"ac42a8aa-dced-43c3-94db-b031eb30a5db","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.502105Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:d7e48c654f8c4b8c91a675688971f373aef88fb2ace0fad3584cfae54e680063","observation_id":"55c12d19-33a6-49b6-895d-5f8a1cf31640","resolution":{"observed_at":"2026-08-07T10:34:05.052301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.031853Z","title":null,"venue":null,"work_id":"4911ccd3-9602-46a3-bd5b-50742d712c61","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.685119Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:496599b554f62a262a0e99f5f4e6f08708ee532a519171a7de6220fe71e22019","observation_id":"b8e8a25f-ff91-4dea-a15b-86c46a14cfcd","resolution":{"observed_at":"2026-08-07T10:34:05.037243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:05.015065Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"79a44126-f98a-4932-aa44-e7e8d2dc77c1","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.792242Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b25ab89d95492f341485015d33bfbbaa9c22f7bcfb1031203987d02011059343","observation_id":"8ae8f700-b529-44ad-89e1-e9cc258ebd46","resolution":{"observed_at":"2026-08-07T10:34:05.021425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.998049Z","title":"Mask textspotter v3: Segmentation proposal network for robust scene text spotting","venue":null,"work_id":"b147ffee-cca8-427e-a05e-5513260e6038","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:56.915356Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:58030f09873dbb4094d359d3dbe0cebf11a908a0a5724b593e6b5dc5c6468b98","observation_id":"09dc5171-96f9-4610-aa75-d5a0d8a44054","resolution":{"observed_at":"2026-08-07T10:34:05.003389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14232","last_updated":"2024-02-01T13:06:51Z","snapshot_observed_at":"2026-08-16T14:32:28.404321Z","submitted_at":"2023-12-21T18:46:46Z","title":"Parrot Captions Teach CLIP to Spot Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14232","snapshot_observed_at":"2026-08-07T10:33:57.108940Z","title":"J., Wang, B., Li, W., and Shou, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.108940Z"},"links":{"cited_paper":"/paper/2312.14232","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:9d099aa7ee47885e30d5d725747c0bbd980269c2ef2ef9c29e15438c80da287e","observation_id":"9bd96913-088a-4be8-9437-307444e8fa51","resolution":{"observed_at":"2026-08-07T10:33:57.108940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.981060Z","title":"Abcnet: Real-time scene text spotting with adaptive bezier-curve network","venue":null,"work_id":"c36de1d5-0837-43ee-a307-bba644281c6b","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.275665Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:ab67076ee0a0fa3448bfc5288e8c4bc1ae89bf9f011831b676de11619c9110dd","observation_id":"a0e84eb5-63f5-4cce-abd7-ad5238686dfc","resolution":{"observed_at":"2026-08-07T10:34:04.986619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.963535Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning","venue":null,"work_id":"efdcac01-4e85-48f5-95ab-e695ac2beedd","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.405128Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:85f69d709a3f5d9363e6812e6502a844f07381f8005093179f8833f51e971ad9","observation_id":"3394719f-ae53-4136-8686-c37337185e42","resolution":{"observed_at":"2026-08-07T10:34:04.968964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.945994Z","title":"Visual and semantic guided scene text retrieval","venue":null,"work_id":"5c54dc46-b7b8-4f50-8e6b-aacd91333c5a","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.566552Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:03a2cf82cd363434ff91d6cb635cee6a0fcdeecabe5f47c020f8fab382dbb370","observation_id":"a6f5e436-a131-431e-9444-31d7188beb4e","resolution":{"observed_at":"2026-08-07T10:34:04.952098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.929444Z","title":"Arbitrary reading order scene text spotter with local semantics guidance","venue":null,"work_id":"6baa8111-a9a9-42fe-bebb-363575f65b61","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.698449Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:d6d18cbc370a0d4ca7383d9045bcbfa11a88729ffde4b86f1cc8cc3f8c7a0bfb","observation_id":"1290ac95-3c8d-498c-8fba-e6136ab610f2","resolution":{"observed_at":"2026-08-07T10:34:04.935312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.910723Z","title":"TextBlockV2 : Towards precise-detection-free scene text spotting with pre-trained language model","venue":null,"work_id":"de312c2b-f5b3-4ae3-b2f3-3181d04c29d2","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:57.885055Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:2742336e2118c3c62af6fe89e4054bde4d16f845a62f0038df44af7ead07adb7","observation_id":"ca4dca92-f899-4c60-a392-a58de153c75d","resolution":{"observed_at":"2026-08-07T10:34:04.917434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.890127Z","title":"F., Gomez, L., and Karatzas, D","venue":null,"work_id":"7bf8c5a6-7d4f-4ddd-9e23-347278c352c3","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.018490Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:58e7bc63ddf9d7f7a2876684dc59363604189939c6c002b3c21a4b3b8849d379","observation_id":"67d2aaff-0a84-42d9-97d3-b142b693894c","resolution":{"observed_at":"2026-08-07T10:34:04.896657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.873894Z","title":"Real-time lexicon-free scene text retrieval","venue":null,"work_id":"f8cd93b1-89c8-4ad4-a580-65bfa7cb6582","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.137410Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:35775cde214b23126ea82ecd68324022ad81c5ada160da0dda288238ed4ad43a","observation_id":"adf89f9b-e367-484c-a52c-d6b0c15db0ad","resolution":{"observed_at":"2026-08-07T10:34:04.879134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.856143Z","title":"Disentangling visual and written concepts in clip","venue":null,"work_id":"248ecc1b-4ca0-4bd1-9f95-99fa21892a2b","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.298068Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:0df90eb8f9c1fd93770810d7fe3f3c1afd842fa45bc561a9d3b178798d4a7fd6","observation_id":"9a27e253-a92b-4800-904f-084ab52987a0","resolution":{"observed_at":"2026-08-07T10:34:04.861704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.839013Z","title":"Word spotting and recognition via a joint deep embedding of image and text","venue":null,"work_id":"8d392a9b-2770-4416-9440-5cee6f6ee1cb","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.501734Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:5406bd52515a9a4360d5d036f7fb542d689f7fd6093c4840a1eef0dc8585a213","observation_id":"0fd555bc-2131-47b9-91f9-7effe32c3009","resolution":{"observed_at":"2026-08-07T10:34:04.845036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.816462Z","title":"Image retrieval using textual cues","venue":null,"work_id":"ed085ef3-0594-485f-a35a-bcc36129742d","year":2013},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.633790Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:3cebc8681fdd0fffd9d7e8945834836d9c8f2e236a5883f80f87f7c1a6e492b9","observation_id":"494d4877-9c19-4f90-8df1-26544445e99c","resolution":{"observed_at":"2026-08-07T10:34:04.824192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.793866Z","title":"Text perceptron: Towards end-to-end arbitrary-shaped text spotting","venue":null,"work_id":"20213d23-92dc-4056-886e-562490c233bd","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.756760Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:dce688827217f52c0f4153044a59d28af30fbc942f949d6e4be1d7b29a868dd0","observation_id":"43fdc69e-fd6a-441f-96d4-c51a7af8dabd","resolution":{"observed_at":"2026-08-07T10:34:04.800334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.770934Z","title":"SEED : Semantics enhanced encoder-decoder framework for scene text recognition","venue":null,"work_id":"bc9d95c7-5a20-4e1d-be64-cbba7647f11d","year":2020},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:58.932601Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:cfc357d438a1b255566a5e412f473e6ba1f71b253201ead579ddf07f79ca6e00","observation_id":"33c759fe-ff90-40e3-899c-695a9e8c2622","resolution":{"observed_at":"2026-08-07T10:34:04.777621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.751704Z","title":"PIMNet : A parallel, iterative and mimicking network for scene text recognition","venue":null,"work_id":"31621fd2-7f71-41e2-ac1b-7c21645191e7","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.113247Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c550c96cbf9383e6bf9d37b0e8ad37d22a646dd0d6202da2d718ec88fec8d67e","observation_id":"26669bf7-34ac-4dc0-9a7a-bb1f1fda7196","resolution":{"observed_at":"2026-08-07T10:34:04.757899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.732640Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":"5d0371ed-ee4d-4122-9912-3a6052ee13e9","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.311002Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:2c6f62a60029588ce3aff0a0a4d9c8ef00b8b1119059fd96f20d80ec2891cb59","observation_id":"c812f105-6f83-4140-90a6-86a2dcbe04b7","resolution":{"observed_at":"2026-08-07T10:34:04.739445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.714859Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"d9a5efa9-0f85-4d4b-ad0c-f488ab527f90","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.490623Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:ebeba3319e1e14a564d29e0ea690bdb8b87dea71629234673404db086575f59e","observation_id":"29099d5c-5d3b-49fd-8f8e-2455b3566cfd","resolution":{"observed_at":"2026-08-07T10:34:04.721235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.692774Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"6e2a5871-42d0-459b-83c4-fd96404906db","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.630256Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:e72b38cfdf80ece18cd09ca314d196d23abdf576452ea23816502e53371f2b93","observation_id":"3193a5a6-dac0-43c3-8005-6a8100dfc4d0","resolution":{"observed_at":"2026-08-07T10:34:04.700159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.670736Z","title":"LDP : Generalizing to multilingual visual information extraction by language decoupled pretraining","venue":null,"work_id":"9bb4a12a-efa6-423a-aee1-1bfe6de34ea0","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.737394Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:c57f311fd67f123910ab4991b7008ab59fea38837a5969f506fc0e1e8073448e","observation_id":"d5948cc0-dc9a-4651-a9cd-0024258b43a4","resolution":{"observed_at":"2026-08-07T10:34:04.677264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.649852Z","title":"and Yang, S","venue":null,"work_id":"db3aef22-8022-4aa4-b20b-d08a624074de","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.865196Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:e036072bd9c4960857342d9fd5e536dab45d41e0983e4ef4acaf507a8d998f9e","observation_id":"36a0a6c3-4e20-452e-bf5d-7be37736e743","resolution":{"observed_at":"2026-08-07T10:34:04.655824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.628306Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"11e01cc9-51fc-41fd-be28-580f0607975d","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:59.999588Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:82232c5d8dbd7e1ba30256fcc54b2572e74bbf3b5357280683a473d3d92d87f9","observation_id":"bb09becc-0361-4559-98c8-9d9091963ae1","resolution":{"observed_at":"2026-08-07T10:34:04.633680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.606291Z","title":"Perceiving ambiguity and semantics without recognition: An efficient and effective ambiguous scene text detector","venue":null,"work_id":"a32be403-cdc9-4514-af39-d30bc3479868","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.150960Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:8fd4e7dca4b064e9a946aa09c3681e9a9eba9b95677bd618a0d043d0f3c2097e","observation_id":"3b8b2a52-613f-4fa0-b765-416e8b945def","resolution":{"observed_at":"2026-08-07T10:34:04.612274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21682","last_updated":"2025-06-05T18:59:02Z","snapshot_observed_at":"2026-08-19T21:55:21.839001Z","submitted_at":"2025-04-30T14:19:29Z","title":"Visual Text Processing: A Comprehensive Review and Unified Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21682","snapshot_observed_at":"2026-08-07T10:34:00.263138Z","title":"Visual text processing: A comprehensive review and unified evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.263138Z"},"links":{"cited_paper":"/paper/2504.21682","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:cf75dc542415dbdb64b9a6f8c7bc0977ad7c3f5f6af2fcd7e5deadb38587dc3f","observation_id":"7582d782-bcc6-4193-a654-25ce888f7cbe","resolution":{"observed_at":"2026-08-07T10:34:00.263138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.587330Z","title":"Text siamese network for video textual keyframe detection","venue":null,"work_id":"5b934c5c-cd66-4e78-9d14-f5e566a1db19","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.423634Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:981393ec6484979cc631d7f537045887b51e5c8cd618a0a64553937c44c0efca","observation_id":"8afb498f-98dd-4c1a-a222-54ea38e52ad3","resolution":{"observed_at":"2026-08-07T10:34:04.592910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05991","last_updated":"2022-05-02T20:08:17Z","snapshot_observed_at":"2026-08-17T09:47:43.697918Z","submitted_at":"2022-04-12T17:55:38Z","title":"ReCLIP: A Strong Zero-Shot Baseline for Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05991","snapshot_observed_at":"2026-08-07T10:34:00.550841Z","title":"Reclip: A strong zero-shot baseline for referring expression comprehension, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.550841Z"},"links":{"cited_paper":"/paper/2204.05991","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:6140a626d89b474994b7eb8023b7d2921895767cb7e7ddbc8930c4374276d187","observation_id":"0b702319-8127-42fb-ab6a-b59835d7f895","resolution":{"observed_at":"2026-08-07T10:34:00.550841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.562438Z","title":"Alpha-clip: A clip model focusing on wherever you want","venue":null,"work_id":"85c5ee0c-756b-412d-9baf-3afacea0de7a","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.739489Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:def3200c3b7d68faf7289dcac54fb82037d174dd02a1d39b7c6afe70f2f11aff","observation_id":"7bab5433-11c0-4b08-a4fa-649066da084a","resolution":{"observed_at":"2026-08-07T10:34:04.567265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.544778Z","title":"Scene text retrieval via joint text detection and similarity learning","venue":null,"work_id":"7ebfe522-3af6-47c5-8729-7a423ec759e2","year":2021},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.863099Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:45f6a3b876b26a51f36fb62c4302342df302295a493da1cd109a8ae53dcee335","observation_id":"6208d676-89e0-4553-b63e-49921c64e1d4","resolution":{"observed_at":"2026-08-07T10:34:04.550844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.525506Z","title":"and Belongie, S","venue":null,"work_id":"e959795d-4549-4e2b-bf06-957553406b4c","year":2010},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:00.975641Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:8991dc1b82445af46702aa6f6d19a64d2c08e42269b6252ab72e7b183da2bff9","observation_id":"98b0e76a-9b63-4201-90b8-5e6fa7dcc40b","resolution":{"observed_at":"2026-08-07T10:34:04.533936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.503971Z","title":"TPSNet : Reverse thinking of thin plate splines for arbitrary shape scene text representation","venue":null,"work_id":"1879ca4e-723b-47a3-b50d-2ae87179fdef","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.158728Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fd4cb40da42f8edc7c86f742288d890c05a087f68492b73a7be76f5b0393f923","observation_id":"0230ef5f-da59-4ce7-8441-fa8aa021f513","resolution":{"observed_at":"2026-08-07T10:34:04.509147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.486983Z","title":"TextBlock : Towards scene text spotting without fine-grained detection","venue":null,"work_id":"eb7b1047-f250-40a3-bb88-5576207b991b","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.308373Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:1f2a10ed150458341dbbc4c02cdccfa21f335ef4548f615d5a96d7dc30c9cbd5","observation_id":"840cf871-9a2c-4b19-9ba7-38f7781a32d6","resolution":{"observed_at":"2026-08-07T10:34:04.492576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.468856Z","title":"Visual matching is enough for scene text retrieval","venue":null,"work_id":"f7c84e01-513c-46e0-89bd-46d1c9e2df12","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.467766Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:dd06f0f7aac2372e50a9441e758b1d0c08aac8dbd10072f420c22c55a6ac885b","observation_id":"05d1d8c1-31d6-442f-aadd-fb08bb350c8a","resolution":{"observed_at":"2026-08-07T10:34:04.475436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.447261Z","title":"and Brun, A","venue":null,"work_id":"2f18241e-4e04-4c7e-98ff-e0e1a2649c67","year":2016},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.645696Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:fb6c80cca0b883749bb4fea460d0a612a6e4f642d5f1dd0861aa6ddb62148dce","observation_id":"d868ad56-f596-4837-bcc9-a5ae60c5d046","resolution":{"observed_at":"2026-08-07T10:34:04.452994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.430076Z","title":"Bridging semantic gaps for language-supervised semantic segmentation","venue":null,"work_id":"eab8a742-e28f-4465-ab9d-3e04395d71c8","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.767073Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:db5ef70c4379f95d6f67d8523c3bb40c3ab4abcd5fc8b971dc9f3c146167bbc9","observation_id":"7787ef5a-3a50-4eac-af92-27cb0176e811","resolution":{"observed_at":"2026-08-07T10:34:04.434978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-07T10:34:01.936414Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.936414Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:39b48a5b8fffd47b99915a5948ee6bc6e048c4a0b71262b5b0aa1e518612ccbc","observation_id":"f1967491-8899-4f2d-85a9-d16e43bfea0e","resolution":{"observed_at":"2026-08-07T10:34:01.936414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.408995Z","title":"IPAD : Iterative, parallel, and diffusion-based network for scene text recognition","venue":null,"work_id":"118ae3fe-f2f0-4dac-89f1-928f139229d3","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.139112Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:11401b951aa94628d219d752af1479338058dbedc7db4a3f11b3423753caf002","observation_id":"d672d0c0-2f1d-46bb-81ac-1a78f2cbf2ed","resolution":{"observed_at":"2026-08-07T10:34:04.415705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.386538Z","title":"Turning a clip model into a scene text detector","venue":null,"work_id":"0a6b1b76-0bb8-43b6-8057-13508e0118c8","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.295822Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:ad740f613476d996d491aabb337bad60c63f27c31e2c62183029a1f952c54731","observation_id":"329c6e7e-26df-4a66-af7f-658495b5cf18","resolution":{"observed_at":"2026-08-07T10:34:04.393041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.364001Z","title":"Beyond OCR + VQA : Towards end-to-end reading and reasoning for robust and accurate textvqa","venue":null,"work_id":"fce7ceb7-6254-4f36-9914-3716e2f81bff","year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.427022Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:1cf8b1ba2052b4c057c6e71d03db07933c045184a9f954144d3cc54998f4db2b","observation_id":"ebecad2c-826a-4bac-b244-797a5e3837c7","resolution":{"observed_at":"2026-08-07T10:34:04.372619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.331584Z","title":"Focus, distinguish, and prompt: Unleashing CLIP for efficient and flexible scene text retrieval","venue":null,"work_id":"4c00ec4e-c43b-49f6-ac6c-446f86769176","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.623053Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:f3652ad4f76fb7744973f1ba0cb89f2901f27930bebbaa69128b6a4f091eede8","observation_id":"0b96d416-462b-4063-8ac6-9952abdee07c","resolution":{"observed_at":"2026-08-07T10:34:04.345456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.303647Z","title":"TextCtrl : Diffusion-based scene text editing with prior guidance control","venue":null,"work_id":"c8daa733-da60-4583-9692-8655aadcfeb6","year":2024},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.764417Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:a41edb5f8b585b7e31aa0a871c3b5ad5e1394f14add1f021e086b907b60f226e","observation_id":"3cec4b21-caac-42c8-99a8-3e5dc85313e0","resolution":{"observed_at":"2026-08-07T10:34:04.314377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.274314Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard","venue":null,"work_id":"34c484df-29fc-4211-bc81-c00a2496fdec","year":2019},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:02.932231Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:a306fe1439ebfcaaec9c420eb41330f4f8715731f2bae3b5bcd02dc44bddeef0","observation_id":"f22ec2ea-6ebf-4912-a5cb-199b77e2db53","resolution":{"observed_at":"2026-08-07T10:34:04.285972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.233614Z","title":"Linguistics-aware masked image modeling for self-supervised scene text recognition","venue":null,"work_id":"6c734bf7-b842-43ad-a680-071935db6ab9","year":2025},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.135547Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:8c40de12ab1e6f908a94b4bf7de9c4fa464ab47ae8de72ce013e11ee9b425366","observation_id":"108619cb-9a22-4768-9e8b-9aa182cd25cf","resolution":{"observed_at":"2026-08-07T10:34:04.257084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:04.036266Z","title":"C., and Dai, B","venue":null,"work_id":"f0efaf98-2edf-4f35-a98d-dffcedb607e1","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.265589Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:963671be9ea853358d9b2b7b75d7a67eecb837f676eff2c57c2a496168cdc4c5","observation_id":"2457c7fe-0a2f-45d4-bcff-032fe5305315","resolution":{"observed_at":"2026-08-07T10:34:04.142177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:03.823284Z","title":"C., and Liu, Z","venue":null,"work_id":"6309375d-7ec9-4340-8be3-0a01c6060cb8","year":2022},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.386877Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:b6a3d39e6519b0c7453ed87d9072314b4ef59be174bddbdb2861b371e06c5b92","observation_id":"7934d71d-86ab-4dcf-8d81-aed4847aa900","resolution":{"observed_at":"2026-08-07T10:34:03.908191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:34:03.546459Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:03.546459Z"},"links":{"citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:6c909e1db6c40e2bd13a1cd58bfd262a72388bb7b1828d57109a7ae93fcd4702","observation_id":"ca56f343-47b7-4f98-b6f0-f9d6456a2e1a","resolution":{"observed_at":"2026-08-07T10:34:03.546459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":50},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2506.04999."}