{"as_of":"2026-08-10T05:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3123178dd43ca6439ee63aa7d50855f43307e204f82c766f6e8cf21d8aded667","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:38:52.885866Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:00:45.178631Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T01:00:46.378040Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"cited_work":{"arxiv_id":"2506.21055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21055","snapshot_observed_at":"2026-08-06T01:00:46.378040Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","venue":"cs.CV","work_id":"b955c816-64c3-474a-888f-e468588e77f5","year":2025},"citing_paper":{"arxiv_id":"2508.04055","last_updated":"2025-08-06T03:30:39Z","snapshot_observed_at":"2026-08-09T10:26:46.157324Z","submitted_at":"2025-08-06T03:30:39Z","title":"Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T01:00:45.178631Z"},"links":{"cited_paper":"/paper/2506.21055","citing_paper":"/paper/2508.04055"},"observation_digest":"sha256:6089f9c0026c03b0c159e6000a01d9f73ad61336087aae2a0c3d9ae81b42bceb","observation_id":"661b1476-0953-407c-9c64-6fdd8c1b667d","resolution":{"observed_at":"2026-08-06T01:00:46.482246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21055/citation-record","integrity":"/paper/2506.21055/integrity","json":"/paper/2506.21055/citation-record.json","paper":"/paper/2506.21055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.364731Z","title":"Visual text processing: A comprehensive review and unified evaluation, 2025","venue":null,"work_id":"ef42b4e8-4386-4e0d-87d8-8925de9d6684","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.244610Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4c238c81783222a74b7ae73607307db4f0c76f83f39128bed408259a6ad08a95","observation_id":"921fc7de-ed9d-4b22-b318-c52ffdcc0946","resolution":{"observed_at":"2026-08-06T22:39:07.469384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.234255Z","title":"TextCtrl: Diffusion-based scene text editing with prior guidance control","venue":null,"work_id":"4fdaa503-d749-4565-9b00-7a7a16d61cc2","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.337723Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:39c9960183fbd1b81f207c98a1536dbfc8dbf6843305d89c610a9cc638609770","observation_id":"df18eaf1-bf02-408a-ab43-ce6eb87f244d","resolution":{"observed_at":"2026-08-06T22:39:07.308125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.149384Z","title":"The devil is in fine-tuning and long-tailed problems: A new benchmark for scene text detection","venue":null,"work_id":"957c40d9-8fe1-4a6e-90f5-ff466ed33262","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.447983Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2576ceebecbd40ce5fe5e4c21628b72dd5c800dc7852b262ba759202ebe18c81","observation_id":"1d63aa5d-024f-478c-85b4-aac2aa887073","resolution":{"observed_at":"2026-08-06T22:39:07.191611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.950552Z","title":"Perceiving ambiguity and semantics without recognition: An efficientandeffectiveambiguousscenetextdetector","venue":null,"work_id":"7f24472e-402a-4a89-86c8-9c0910e7ecbf","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.543916Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:287511093acc063ee59007dadb69eb93a73a7b337a813483bb12cac2dd138a94","observation_id":"c0631c98-09bc-439b-96dc-6aab131559b3","resolution":{"observed_at":"2026-08-06T22:39:07.094259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.635877Z","title":"Self-training for domain adaptive scene text detection","venue":null,"work_id":"78819c2d-1dbd-46da-995f-bb4a13f269cb","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.630584Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:7757e2997ef25f724f0feb9c0b7ad67cdef57373187dab8a603b49845ec4355a","observation_id":"b7258021-25c7-4364-aaf7-fb2b4d237f6a","resolution":{"observed_at":"2026-08-06T22:39:06.779164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.337868Z","title":"SEED: Semantics enhanced encoder-decoder framework for scene text recognition","venue":null,"work_id":"54a8d0c2-bf53-470a-a0b3-c4cac58abe11","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.798650Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:1b6960fd5a0027513ff93e08ee94271679180a8f3372850deaca1f38a4262f2c","observation_id":"a18ddd1f-7c39-40ab-9387-09568c8e5927","resolution":{"observed_at":"2026-08-06T22:39:06.455255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.975524Z","title":"PIMNet: A parallel, iterative and mimicking network for scene text recognition","venue":null,"work_id":"c3ee1aec-28fc-48e2-9e8a-bb5d05912577","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.854090Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:7224d3d972c2aa1b1f1946d07e56d86f9f1b40b7455848a7a0f4f6e84d085123","observation_id":"befb8960-ebf7-4d31-93d5-b3eedda41466","resolution":{"observed_at":"2026-08-06T22:39:06.191742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.713666Z","title":"IPAD: Iterative, parallel, and diffusion- based network for scene text recognition.IJCV, 2025","venue":null,"work_id":"773b3458-be3a-4833-8778-08e7382a44a7","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.967109Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ca1528b6a51aced9969f2c55517d2e856aae2e463594924a564b5df3fafda785","observation_id":"e2015c11-edbe-4f8a-bbc2-2ca4c0337895","resolution":{"observed_at":"2026-08-06T22:39:05.840804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.386099Z","title":"Linguistics-aware masked image modeling for self-supervised scene text recognition","venue":null,"work_id":"65201c17-4e49-4918-a1c6-cc69075ade19","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.064931Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ed6846d791c3ceee941285135d355d56159a441d3d8444a796f49dfc70ea619a","observation_id":"8f606f82-ca5a-4ca6-a420-9a38f1192faf","resolution":{"observed_at":"2026-08-06T22:39:05.551498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.141953Z","title":"Divide rows and conquer cells: Towards structure recognition for large tables","venue":null,"work_id":"d8358538-a273-430e-a291-39262562a06f","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.122530Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4ce13fd67e9ada3b85433e325fe46558f2be2e13612953472704d55ec3da4ec8","observation_id":"8c5985b4-d06c-44e9-89e7-35297a2116db","resolution":{"observed_at":"2026-08-06T22:39:05.267140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.918404Z","title":"Arbitrary reading order scene text spotter with local semantics guidance","venue":null,"work_id":"4de8606b-66bc-405a-8124-d05092521bd3","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.179175Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:86dac2540869208ddbb65b61b10fb6f4b112c90a28b1c288193f7f10bcbd186d","observation_id":"2612607d-2fcd-45c7-b656-4f5e1e9d79aa","resolution":{"observed_at":"2026-08-06T22:39:05.022831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.641669Z","title":"TPSNet: Reverse thinking of thin plate splines for arbitrary shape scene text representation","venue":null,"work_id":"d5d0192a-b3d7-4b77-9d78-a67c25639f8a","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.296450Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e34f467c0028cb590d54d310693ca1014e16c979d8c7fa8d7f13b74cfb7260f4","observation_id":"072b1ef4-639b-4fd7-92cc-c02dec23a787","resolution":{"observed_at":"2026-08-06T22:39:04.787577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.400036Z","title":"TextBlockV2: Towards precise-detection-free scene text spotting with pre-trained language model.TOMM, 2025","venue":null,"work_id":"81c3325d-0a69-4635-85bc-93b8e7d59a58","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.370098Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3e6665d0791c06e108be26a33b7a34d4f587f25c356fed8b1bf892b8c6154744","observation_id":"bf975ee4-71aa-4dee-b357-45d8d148301d","resolution":{"observed_at":"2026-08-06T22:39:04.532935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.144897Z","title":"Beyond cropped regions: New benchmark and corresponding baseline for chinese scene text retrieval in diverse layouts","venue":null,"work_id":"0db8746f-6d77-4384-b62f-42ae62baa2f3","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.459786Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ae550a4b611d21578039d8c01022d65a1a09645ffc3dfc729c449cfd7f506072","observation_id":"21ebe37c-f3b9-43a7-b60f-1a18f559afda","resolution":{"observed_at":"2026-08-06T22:39:04.278269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.931659Z","title":"Focus, distinguish, and prompt: Unleashing clip for efficient and flexible scene text retrieval","venue":null,"work_id":"12580835-83f5-40fc-a987-b55120e4b8e7","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.545081Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:a9afa4e52e9e448edad2c36f88dc7f2b3160707210052a86376b48f3bd69cf31","observation_id":"454355a7-ea8f-4663-9f4e-cead2a9f40ee","resolution":{"observed_at":"2026-08-06T22:39:04.032662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.706742Z","title":"LDP: Generalizing to multilingual visual information extraction by language decoupled pretraining","venue":null,"work_id":"14c0e401-cf6c-4878-a32e-98602aec2416","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.602859Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4c11420ce55e77d7f92486d6e20217c938028ceca83ed2a10cc440fa303a1692","observation_id":"4099a824-0b80-49ba-b8e6-9108ffe30297","resolution":{"observed_at":"2026-08-06T22:39:03.837997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.440741Z","title":"Beyond OCR+ VQA: Involving ocr into the flow for robust and accurate textvqa","venue":null,"work_id":"276f38df-e7b7-4f97-a32e-88e82d3b9a88","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.657087Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:57b9fbb23ed469bbfc5a69115df6842e36e3e3899a988ac63eaea0929877e361","observation_id":"7733c693-127c-4ebf-a474-78af895e95e5","resolution":{"observed_at":"2026-08-06T22:39:03.573020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.202459Z","title":"Publaynet: largest dataset ever for document layout analysis","venue":null,"work_id":"6dae5be7-0d36-4f7c-924c-157e2d1932e4","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.734594Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:48d4878314e2cd7ff6204ebc9fc9461a5c69bfea40954d2bf0ee05cff9f8fc37","observation_id":"60a873fb-d4fa-43f5-89c3-1a5efd2ab323","resolution":{"observed_at":"2026-08-06T22:39:03.338918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.966896Z","title":"Learning to extract semantic structure from documents using multimodal fully convolutional neural networks","venue":null,"work_id":"06bdb48e-889b-44e2-956a-78865c386113","year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.884876Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:a5e48b2c5fc0bde1594d6c552e9a68de09dcb48e151d1f44406b02a2d4b6da4d","observation_id":"cd3e0c06-de16-45ab-a706-873f2996d133","resolution":{"observed_at":"2026-08-06T22:39:03.076783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.751716Z","title":"VSR: a unified framework for document layout analysis combining vision, semantics and relations","venue":null,"work_id":"c3db144f-abc2-4036-aabd-aa60ba1c43c3","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.052018Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:cc2ed580bc8c1b7ce8656400ba4ca5c05942a603434d1c61b414e0b5ff1abf51","observation_id":"8767b378-67d6-4a8c-9eee-a328f48daba3","resolution":{"observed_at":"2026-08-06T22:39:02.857871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.518677Z","title":"Attention where it matters: Rethinking visualdocumentunderstandingwithselectiveregionconcentration","venue":null,"work_id":"a2d3341a-9e1c-4edc-8d04-04a6e953366a","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.173827Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2c736f5fa0f6c78cff47dbf3a3e645c674500ebe21d0accb578f584c1d9a3eb4","observation_id":"0cb19cfa-b771-4b1d-8803-ce424b18c711","resolution":{"observed_at":"2026-08-06T22:39:02.651105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.375286Z","title":"Bros: A pre-trained language model focusing on text and layout for better key information extraction from documents","venue":null,"work_id":"08111d35-e141-4999-9725-5452dfaaaa19","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.263161Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:06a655e7f3d6148780c200bcba00f3ad46ba48db96b8d34e458a0f03c190d7c9","observation_id":"e4ec6bb0-f924-43c6-b61f-e0cd703c6372","resolution":{"observed_at":"2026-08-06T22:39:02.453593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.277206Z","title":"StrucText: Structured text under- standing with multi-modal transformers","venue":null,"work_id":"071e82ec-34a4-46db-a47a-19a70f42fbb5","year":1912},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.330162Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:40ee86f216c7065aca6b04e7272f779abaeae98730b0709a7d3e5361d9e3b724","observation_id":"a4c66329-f255-4372-805d-1e8ff5af512b","resolution":{"observed_at":"2026-08-06T22:39:02.323169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.164503Z","title":"Cross-domain few-shot semantic segmentation","venue":null,"work_id":"4129e1b4-62e2-44b1-a446-5efe8da1f745","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.417873Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2a775425aa5e46d35745cefb56284a04ad9f1519e36a6f48523201ed1200dc40","observation_id":"2bdf5d4c-4b64-4e8f-b2e2-536026302043","resolution":{"observed_at":"2026-08-06T22:39:02.222363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.029248Z","title":"Pixel-by- pixel cross-domain alignment for few-shot semantic segmentation","venue":null,"work_id":"a0863946-c27a-46c2-b9e7-921c0142a233","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.483181Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:01c36f906c40b24a82259716ea891466e1b829b2fe09599adedd3eab0daab183","observation_id":"1770ce1e-e27e-436b-ac3b-e21f24fc2741","resolution":{"observed_at":"2026-08-06T22:39:02.088914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.882236Z","title":"Restnet: Boosting cross-domain few-shot segmentation with residual transformation network","venue":null,"work_id":"d10f0a31-0aa9-467f-a737-caa1504a816f","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.565011Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e36a05253a0c6699a7ea2e6b7543630a7dd39bb7c2ca11e288ec1bd414c1c31d","observation_id":"fd412c3c-44a6-4cf5-a217-accfda4fc02a","resolution":{"observed_at":"2026-08-06T22:39:01.952099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.713399Z","title":"Adapt before comparison: A new perspective on cross-domain few- shot segmentation","venue":null,"work_id":"fc022cc4-55f5-4c77-ac37-83673c0ec2f7","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.631042Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:8c7eca7e7417b3a95442d7a60665455fd6124b6ceecb5e57d300cb14a265aef1","observation_id":"8fb3ee38-27cd-4b28-aa17-9fb62b5c1263","resolution":{"observed_at":"2026-08-06T22:39:01.792650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.548431Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv, 2024","venue":null,"work_id":"a9477d77-8c17-433f-ab1e-8fd784c996cf","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.697756Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:a41558f7488116acf2c20669a442134b53d703256f6ba7c04b3321d91136aafe","observation_id":"1d813d51-284f-4518-8788-82ea6d872de7","resolution":{"observed_at":"2026-08-06T22:39:01.625785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:48.763757Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.763757Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:b116fba1e41194820f6aecfbe59247d6ccedc85bd20d32a1807ab7d249997e50","observation_id":"6549c2e4-07d8-425e-ace6-cd27321e2a16","resolution":{"observed_at":"2026-08-06T22:38:48.763757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.346416Z","title":"Faster R-CNN: To- wards real-time object detection with region proposal networks.IEEE TPAMI, 39(6):1137–1149, 2016","venue":null,"work_id":"e323960b-6208-4eef-a42e-7ed2832c0941","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.852730Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:674c376791a379b706ea5bfe196f39c920b6d1869582f218f573111edb57cb30","observation_id":"1a78d34e-21c0-48f7-89c7-24794415f3a5","resolution":{"observed_at":"2026-08-06T22:39:01.431066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.158661Z","title":"Mask R-CNN","venue":null,"work_id":"fbe8902a-41a5-4152-9d0e-ef57dcc158c7","year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.916308Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2182813c52ea64adcffe3de160c25873620c5185cf8e8fb121f4138ad61754a1","observation_id":"38ef0995-0746-40c9-a746-8330974fa688","resolution":{"observed_at":"2026-08-06T22:39:01.256642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.008457Z","title":"M6doc: A large-scale multi-format, multi- type, multi-layout, multi-language, multi-annotation category dataset for modern document layout analysis","venue":null,"work_id":"e607dbe7-9153-4c93-813f-93f6b4d71e1e","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.998791Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0ef6972578925f28cdec408e86f298eb5d9a3b04b037cc96b547058772e007b4","observation_id":"ccd31602-49ff-4d2a-bad1-7d7c4c2d1948","resolution":{"observed_at":"2026-08-06T22:39:01.093467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.787749Z","title":"Swindocseg- menter: An end-to-end unified domain adaptive transformer for document instance segmentation","venue":null,"work_id":"bfe0f0cf-3fec-4a56-91ec-2006737aa509","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.064809Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:bd319e99de08c7090ac96036ec26efa1f79925792f7b6d2e31e9a83f0e9b4c4e","observation_id":"45a2b99d-e596-4b45-9262-528555db8a48","resolution":{"observed_at":"2026-08-06T22:39:00.869863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.592915Z","title":"Dino: Detr with improved denoising anchor boxes for end-to- end object detection","venue":null,"work_id":"496975fb-08fb-4b13-af50-dce748b30dc7","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.137703Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:c40989bee93200164097ef5e46aafa2d67508809ae43928d1775047e2a9af65f","observation_id":"bdb1cb97-3bf9-4cb2-8b7d-2609161a6dc4","resolution":{"observed_at":"2026-08-06T22:39:00.696527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.407899Z","title":"Selfdocseg: A self-supervised vision- based approach towards document segmentation","venue":null,"work_id":"47364a51-eee8-428e-9758-3b54552235c4","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.218198Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:c38b81579c4e64a03c62181d704e9c4d166fcd670b212d0d78ac9d5c4935db21","observation_id":"d3f580ce-5f7a-44ab-837c-11e42be7dd61","resolution":{"observed_at":"2026-08-06T22:39:00.503904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.226244Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.NeurIPS, 33:21271–21284, 2020","venue":null,"work_id":"9e1071d6-e85e-4148-b298-bbe09cd758ec","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.286253Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:98876a93339984951a60e33257b93cb91b1224407b83c6fd68756b40dcd71aaa","observation_id":"6c2e2959-6cb4-42e9-ab25-eede11b423c8","resolution":{"observed_at":"2026-08-06T22:39:00.307140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.976919Z","title":"LayoutLM: Pre-training of text and layout for document image understanding","venue":null,"work_id":"447ef6ee-363e-4713-a2c6-e3a27caf1bb8","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.367911Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:df404806438b705e859d9013f6a9d0c313fd6ecdec541c46126fee2f96dc2358","observation_id":"4fd51609-9479-4c31-8847-8f59f16e751c","resolution":{"observed_at":"2026-08-06T22:39:00.111955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.723000Z","title":"LayoutLMv2: Multi-modal pre-training for visually-rich document understanding","venue":null,"work_id":"da3b1498-aa29-437d-8150-db4687c9216e","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.431705Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:6f632faab7ae8126b1f575ef2be4e9660914178dd947bbd999b96ad9edd2045c","observation_id":"bd1cdc0b-a5f2-44ec-9107-a78563609979","resolution":{"observed_at":"2026-08-06T22:38:59.856115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.565767Z","title":"LayoutLMv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"121b2f21-0cde-430c-a53c-65ebed5f8cfb","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.514096Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:35e632aa00e1463b9a45471f1c04358a45ed941700806aa047723709629d8893","observation_id":"c7a268cc-318d-4031-a919-113652112c41","resolution":{"observed_at":"2026-08-06T22:38:59.630342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.389479Z","title":"BEiT: Bert pre-training of image transformers","venue":null,"work_id":"80e1c18e-fc6e-4444-a7ef-0f0b8d35c5dc","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.605131Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ceb5bdbd7b671ba9014afaa0c36becee869e31733caef54cb0433a0bfcae5221","observation_id":"ba44459e-6ed5-46a9-be01-a926abcc3ff1","resolution":{"observed_at":"2026-08-06T22:38:59.452465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.221920Z","title":"Dit: Self-supervised pre-training for document image transformer","venue":null,"work_id":"49c293a1-d4b9-47e6-9acc-c96bb024f65e","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.686587Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:661235ffacf8066813482e7551ba6b3a71a3d49b446c2d5091f8037863dd4eb1","observation_id":"ed2a9473-153f-43df-9191-7e23a1845954","resolution":{"observed_at":"2026-08-06T22:38:59.299826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.088261Z","title":"Unidoc: Unified pretraining framework for document understanding.NeurIPS, 34:39–50, 2021","venue":null,"work_id":"cd1dccc7-4773-4fd3-a0f2-21430b374517","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.769931Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3b4f5e29232a9f9cfd16ae4aa05e0d97e3a3a9bf99f6b573c6ad7fb0f3f466ce","observation_id":"bec3a72a-68e0-4b71-8ee4-6e1ef1ee57f5","resolution":{"observed_at":"2026-08-06T22:38:59.149271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.880698Z","title":"StrucTexTv2: Masked visual-textual prediction for document image pre-training","venue":null,"work_id":"71762673-2d40-4eba-b906-00d8adb5ac19","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.839305Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:fd7eb463099a71c58f6a6ed95152e8a8b3776c85d0ce9c5fbe907ab26d85b1d7","observation_id":"9e3fc858-264f-42e4-85a7-4d89f5acca7e","resolution":{"observed_at":"2026-08-06T22:38:58.975299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.631799Z","title":"Apseg: auto-prompt network for cross-domain few-shot semantic seg- mentation","venue":null,"work_id":"e3b39e6e-f9fc-474b-8b65-bf7e82d45135","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.953976Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:eca4a42ea9d62ffc0981fd2b0165464d8cdb395db07d06c21d9057e9e1df3977","observation_id":"c2564ae8-2255-4ef7-828e-ca25a88b8418","resolution":{"observed_at":"2026-08-06T22:38:58.760955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11591","last_updated":"2021-08-27T04:56:07Z","snapshot_observed_at":"2026-08-10T04:47:48.064490Z","submitted_at":"2021-08-26T05:52:32Z","title":"LayoutReader: Pre-training of Text and Layout for Reading Order Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.11591","snapshot_observed_at":"2026-08-06T22:38:50.023808Z","title":"Layoutreader: Pre-training of text and layout for reading order detection.arXiv preprint arXiv:2108.11591, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.023808Z"},"links":{"cited_paper":"/paper/2108.11591","citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:07fec3c6ddfb09ab585b45d70edca993d8fd9008efa6b52aaf3cb98b5b005e59","observation_id":"80159f3f-5dad-4ee6-9529-1f87ec88f970","resolution":{"observed_at":"2026-08-06T22:38:50.023808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.307425Z","title":"Reading order matters: Information extraction from visually-rich documents by token path prediction","venue":null,"work_id":"ec76f63c-4cd7-4baa-8fa6-a5556a11497a","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.087919Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:585eb64ccfed170105f17934efea01cf1d27a3f37db0828d65f3427bc16bb3b2","observation_id":"0390b3f2-4f8d-4df2-aa48-69cc5f54a847","resolution":{"observed_at":"2026-08-06T22:38:58.459424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T22:38:50.217063Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding.arXiv preprint arXiv:2104.08836, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.217063Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0093ca6d83a502bc43fbb259ef6daacb1cb742c027db71c81f14b1ceea745dc7","observation_id":"6b26cf17-dd66-49f4-9a30-dd7cdb7bedb3","resolution":{"observed_at":"2026-08-06T22:38:50.217063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.094489Z","title":"Query-driven generative network for document infor- mation extraction in the wild","venue":null,"work_id":"25c64872-b923-4d70-8202-1385f7623401","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.316580Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:20a9e9a1566d2b9f4d6be70b1196c40dd3e51c1c64ac96fc9fa36a780fb40036","observation_id":"7e986b6d-11bb-439b-bcee-4ef7f39d01c5","resolution":{"observed_at":"2026-08-06T22:38:58.207453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.828200Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"54f8c5e6-af0b-4c6c-befb-16e26b33f7a9","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.398051Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ee53d38cc5a4829dc6b76db37efc96f31551f94f2dfb6867f2a801a84806702a","observation_id":"31d1c692-08ff-4ada-8599-57c0c2b10db9","resolution":{"observed_at":"2026-08-06T22:38:57.991072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.535218Z","title":"Pix2struct: Screenshot parsing as pretraining for visual lan- guage understanding","venue":null,"work_id":"16f5db4c-28c8-4b75-8cd7-d005b63146a8","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.479272Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4180706e8941461bcd3886447b940e572d97c74a0bce3634497dc01fde695543","observation_id":"68e6649e-86f3-4a96-b3eb-48491fb2c388","resolution":{"observed_at":"2026-08-06T22:38:57.639310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.267872Z","title":"Prestu: Pre-training for scene-text understanding","venue":null,"work_id":"3c85ce84-ce84-4834-980b-a031f6df52ab","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.561971Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:31d014bb4c57e9571b9ae85511005bfe14d0e6a2e21bdd40df8acf8e5ad3750a","observation_id":"64f29873-8af6-4ea0-a559-09d700bfab73","resolution":{"observed_at":"2026-08-06T22:38:57.381479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.020559Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"a7986dc9-c277-402a-b5d3-430104f8c6f2","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.644742Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3e31ea716cc29f88ba7e2f55f3b7aad22a9c3abc0f7a617578fdf5e07ff62620","observation_id":"e4bb6a95-268f-453a-8315-0ee722efac8b","resolution":{"observed_at":"2026-08-06T22:38:57.147611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.790259Z","title":"Omniparser: A unified framework for text spotting key information extraction and table recognition","venue":null,"work_id":"624e33e2-79f4-4e16-a98a-bf53f6191138","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.729423Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:f2ad81b1c819f04fd028794bda308863c8f3eedc487f3c5ff1a2009f81d7f994","observation_id":"3a004b56-f5cd-4783-b87c-90adcaba4625","resolution":{"observed_at":"2026-08-06T22:38:56.887151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.533535Z","title":"Icdar 2023 competition on structured text extraction from visually-rich document images","venue":null,"work_id":"5c727fea-cce1-49dc-b46b-334c7385c78b","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.821629Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4f1d46b8251b626b32dc3a10052391dfe57c76465e0fe32de63835b05f62fd2d","observation_id":"da40e932-5620-4d21-a338-cd5687f3217c","resolution":{"observed_at":"2026-08-06T22:38:56.677371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.225065Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":"fdf412ef-9f06-4dc5-bdbc-4de683d285ff","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.897607Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ed15f84a11f4c782f49fa9df1225f66469f8119444a9be6c46445850c24136c9","observation_id":"94aaa468-dfda-487a-ae04-e1e26405d1f2","resolution":{"observed_at":"2026-08-06T22:38:56.358785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.910698Z","title":"Towards robust visual information extraction in real world: new dataset and novel solution","venue":null,"work_id":"f6b98714-ed31-4a12-9510-36b81237b87c","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.976474Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:89ab52237ace0f7c1844f7cb8de2b9047c20395bf4a9e73757951462eccaa802","observation_id":"026f45d3-d935-4b2d-95da-1b95a43a1431","resolution":{"observed_at":"2026-08-06T22:38:56.024979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.677714Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":"14e85ef7-2436-4a3d-bba8-db0a1035b29d","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.112398Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e22e3af68dc9078d3287064f95b4b33cc39c7528b3fb5c0cdce208cb613f307a","observation_id":"bdb503a7-3326-4655-8877-de82da18290f","resolution":{"observed_at":"2026-08-06T22:38:55.751681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:51.219412Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.219412Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:7c262fb3df4b37e33dbffa2a7c1efda66534c76c6227b11341b100e23fe7e748","observation_id":"dc544755-391a-4288-92c4-ff83b9bb14cc","resolution":{"observed_at":"2026-08-06T22:38:51.219412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.351386Z","title":"Real-time scene text detection with differentiable binarization","venue":null,"work_id":"2afbcea2-721a-4b9f-9e40-7a71da220070","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.387932Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:93239d3289455ea32694b757c703ca697f5c01f7907152632f34952bd0e68c7a","observation_id":"01ab366c-0e36-4a60-bf49-d9fff2658d86","resolution":{"observed_at":"2026-08-06T22:38:55.474643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:51.530059Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.530059Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:90bc61d37cc68863b250ff93f05bf6d03d75f2d2b8e282a5e75d7114c5c46748","observation_id":"a0e08d6b-a1dc-47a5-97b3-d87dc9b97941","resolution":{"observed_at":"2026-08-06T22:38:51.530059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.081836Z","title":"Efficientandaccuratearbitrary-shapedtextdetectionwith pixel aggregation network","venue":null,"work_id":"2eda28be-fb14-42c2-a95b-8bbcdd5a3ea7","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.659159Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:618eedd7618f23742844e8e4bb430be54abeee82cb3040eff49c1d42c4a165f1","observation_id":"fe67d8f9-c8f3-483c-9b5e-a9ed0e9f5986","resolution":{"observed_at":"2026-08-06T22:38:55.225749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.824978Z","title":"Shape robust text detection with progressive scale expansion network","venue":null,"work_id":"5cf442d5-ac3a-40cd-92c1-c43d2791d978","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.821754Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e618dd44200f2ac750d312a8fb0bb69d13cdc4ed7f207351260ab11d7de4ca33","observation_id":"6fc7b2c6-a439-431f-ae7e-d7dd0309327d","resolution":{"observed_at":"2026-08-06T22:38:54.949428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.493071Z","title":"A generic solution to polygon clipping.Communications of the ACM, 35(7):56–63, 1992","venue":null,"work_id":"d93596de-d280-42db-90c6-091f05fe8d45","year":1992},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.965400Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3f4ae56ceafaccfb3f4c74aa4e10f1f3782d8e38ee457c91046d4a5c3e9317e4","observation_id":"edf911ce-c13f-4f4a-a370-2b9959512f2a","resolution":{"observed_at":"2026-08-06T22:38:54.663913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.236314Z","title":"V-net: Fully convolu- tional neural networks for volumetric medical image segmentation","venue":null,"work_id":"5ae10ec7-b0f3-4a32-98bf-5cae6c30c3c4","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.125240Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3138f60c2b8dcb4dc328d52bf466852abaaf20d3e8f1cb557f927ddabd3f9547","observation_id":"395d7cfd-e4d7-463e-9f3e-02eaa991ba05","resolution":{"observed_at":"2026-08-06T22:38:54.372938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.950394Z","title":"Training region-based object detectors with online hard example mining","venue":null,"work_id":"5c2f03b3-a10c-471e-8248-699157304558","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.274840Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:c32e41630fcf8df31a8a96966c6de65815e836007b00ac22ae30918f7de067c5","observation_id":"09de82e0-2bbc-4445-9909-693faa3671fb","resolution":{"observed_at":"2026-08-06T22:38:54.103426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.661778Z","title":"Dmt-net: Deep multiple networks for low-light image enhancement based on retinex model.IEEE Access, 11:132147–132161, 2023","venue":null,"work_id":"68aa1cb4-eae4-45f5-94b0-e58c4e2252d8","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.465452Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0af5b4cecea92bd8bdabe145464b2ad214fac41678e1c7fa29583d408c13fe47","observation_id":"94ac7c68-494d-4262-8737-05185d07ddc9","resolution":{"observed_at":"2026-08-06T22:38:53.812556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.326182Z","title":null,"venue":null,"work_id":"e37b011f-d2aa-4211-933e-180f286a1fa0","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.581101Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:5995a76f2bb52b8831a9d36c91ef3c099ce1a145f728402b3a8a9811a99ff588","observation_id":"999875d5-e24c-4821-9bb2-7c0f694d397b","resolution":{"observed_at":"2026-08-06T22:38:53.465708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:52.729353Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.729353Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:016cae5f28fa5d76262139b6bcecfcd18b903454bc488602d490fee95983c434","observation_id":"465e695b-7e91-463e-8c67-c07c5f834a6f","resolution":{"observed_at":"2026-08-06T22:38:52.729353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.081256Z","title":"A survey on curriculum learning.IEEE TPAMI, 44(9):4555–4576, 2021","venue":null,"work_id":"a0ec65f3-95ed-4bdc-badc-d5482904155e","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.885866Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:83c9fa1a26eb1f5eeae3cd7b7e6058065309d85d14d066b75b1c1f88fbba6c1b","observation_id":"052211b5-7a88-4440-8b13-39a46988d0f8","resolution":{"observed_at":"2026-08-06T22:38:53.247945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:47:57.408393Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 1 inbound Pith citation observation for arXiv:2506.21055."}