{"as_of":"2026-08-10T00:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:675c3b3c3bf340bd44a1ede24857618201f2dde423a066e2b4a76c3220567da8","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:07:54.402782Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12490/citation-record","integrity":"/paper/2507.12490/integrity","json":"/paper/2507.12490/citation-record.json","paper":"/paper/2507.12490"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.766419Z","title":"In: Proceedin gs of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"4f2812ce-cf91-48e1-9483-2d6f143b12c5","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.422420Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:4a5ad635ed82b5fb3e03c67e54c7cd8cf0ee99b44102de9106149a0726a4ee14","observation_id":"0f40e080-bd1d-4602-a9a9-299172ff8252","resolution":{"observed_at":"2026-08-06T17:07:56.878906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:52.513301Z","title":"4290–4300","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.513301Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:666be0b66e2c460719f7acd9aa6923ae9ca8421c3adb22b1426d215cfd55f80b","observation_id":"49e34a29-2d3c-479a-9316-6c6c8e621f93","resolution":{"observed_at":"2026-08-06T17:07:52.513301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patrec.2021.06.026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.473657Z","title":"Pattern Recognition Letters 150, 242–249 (2021)","venue":null,"work_id":"272880c3-8997-4508-bb99-677a9a7f3e6c","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.593231Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:b17df2fe7ceb672d8599c0027842b0279ba70419bf6e953128a350659adecdf9","observation_id":"792ca61a-d574-44fc-bbd4-8aa07850e039","resolution":{"observed_at":"2026-08-06T17:07:54.543867Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-10T00:01:53.009712Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-06T17:07:52.666510Z","title":", Huang, F., Zhou, J.: mplug-docowl2: High-resolution compressing for ocr-f ree multi-page document understanding (2024), https://arxiv.org/abs/2409.03420","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.666510Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:536345d8969623d8d15eb8fceccccce3a89f6978af438c579116edbd2d641de5","observation_id":"1e4266db-48e4-4e6e-90ed-a8f540d82797","resolution":{"observed_at":"2026-08-06T17:07:52.666510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:52.747544Z","title":"In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recog- nition (CVPR)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.747544Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:5506860b27c19d530e2be346301992d589ac25c860888236cbfbd0b0559c40ce","observation_id":"57f7fc36-5dae-4faa-aa87-e576c9420f82","resolution":{"observed_at":"2026-08-06T17:07:52.747544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.562290Z","title":", Le, Q., Sung, Y.H., Li, Z., Duerig, T.: Scaling up visual and vision-langu age representation learning with noisy text supervision","venue":null,"work_id":"1c22f255-6545-4ab7-a093-8dac57864b3c","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.849169Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:c870c3d58b1d63675f3ddea06cb9b0a1ac28e230a866c2d51368cb7ca82f5fa3","observation_id":"6b80b483-998d-4af9-8f1a-fd14e141652a","resolution":{"observed_at":"2026-08-06T17:07:56.649166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.450375Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"c989ccca-90b8-48af-909c-c141dde36cbb","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.991227Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:7497f1c748310a9d0c9ac1a7b8bf87ce25225446bad9e5bafe1d7cfb113a00f7","observation_id":"fe155ab4-0f54-40be-aba1-65d4068bdd88","resolution":{"observed_at":"2026-08-06T17:07:56.509448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.324308Z","title":"In: Krause, A., Brunskill, E., Cho, K., Engelhardt, B., Sabato, S., Scarlet t, J","venue":null,"work_id":"966999b2-274f-443e-8201-2bc63502283b","year":2023},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.076926Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:6c141f386febbf6f2f7dfef75653c04ac93b58cca3890bc212719c8d58ff5d2a","observation_id":"2033bde0-f91e-484d-80fe-e51dd8abe144","resolution":{"observed_at":"2026-08-06T17:07:56.395421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.186357Z","title":"In: Chaudhuri, K., Jegelka, S., Song, L., Szepesvari, C., Niu, G., Sabato, S","venue":null,"work_id":"4af288ae-103d-4a40-8cc2-b1f7089c177a","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.150218Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:1036d5fada84cd113885cdd570f66c1ad236bcd8c73730a07e3793a3a1adfc3a","observation_id":"63e3231a-10b2-406a-aa7c-06d68f5fc3de","resolution":{"observed_at":"2026-08-06T17:07:56.258565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03896","last_updated":"2025-06-10T09:20:36Z","snapshot_observed_at":"2026-07-06T17:26:10.790336Z","submitted_at":"2024-02-06T11:07:05Z","title":"Multimodal Rationales for Explainable Visual Question Answering","version":3},"cited_work":{"arxiv_id":"2402.03896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03896","snapshot_observed_at":"2026-08-06T17:07:54.880932Z","title":"Multimodal Rationales for Explainable Visual Question Answering","venue":"cs.CV","work_id":"917d561e-423b-4b49-b3e2-7e48bc86a6bc","year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.224963Z"},"links":{"cited_paper":"/paper/2402.03896","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:6d3df132e54288082891938cfebc4fae563a0ad04f924e833ead1c1eb36037eb","observation_id":"64518d66-6287-431b-bb90-c0e23b7515cb","resolution":{"observed_at":"2026-08-06T17:07:54.956540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.044828Z","title":"In: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M","venue":null,"work_id":"c61ae4b7-dab4-4e3f-bded-6614791eb36a","year":2023},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.317817Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:dbbce7ac00e601d4e605f656a5695721dbfe805e991bd3cc72b3102a9010b144","observation_id":"43fea144-a5dd-4d2c-8b09-ac79d5b0b30b","resolution":{"observed_at":"2026-08-06T17:07:56.118590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.920434Z","title":"In: Proceedings of the IEEE/CVF winter conference o n applications of computer vision","venue":null,"work_id":"6f2b96a4-0e60-4b98-84c0-8d18cc2c958a","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.417551Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:75cadc4982d9f5d1c5b079c42eea470233660eaf0ad1b3489d40d2ed3b39f79d","observation_id":"604c8031-6688-4ef7-9f19-cd35ea01d861","resolution":{"observed_at":"2026-08-06T17:07:55.976919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-06T17:07:53.544005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.544005Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:745a8aeb1eb6b7fd5aa45bca192bcf787701f6206d620de34651507f72e319fe","observation_id":"b8fcff72-8148-4bbc-8735-301968efb62e","resolution":{"observed_at":"2026-08-06T17:07:53.544005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.806327Z","title":", Pietruszka, M., Pałka, G.: Going full-tilt boogie on document understanding with t ext-image-layout trans- former","venue":null,"work_id":"b18073a9-e5c5-41a2-9e68-f557282df588","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.639104Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:c739930b585a9f384a53cf2ae766a4953bdabbc2a930f3f43a1d2ec92cdde213","observation_id":"f32de7c0-4fbb-423c-8390-52f65fd8c9d4","resolution":{"observed_at":"2026-08-06T17:07:55.852534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.518007Z","title":"In: Meila , M., Zhang, T","venue":null,"work_id":"c86ee21e-8954-4690-b3cf-f4efe3c780d1","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.830975Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:40b271239f4964b8a23effd855c3419d47dda29a56b9a14728f7714cc5101f98","observation_id":"75f70c2c-573a-45c4-aa15-8ff741b25099","resolution":{"observed_at":"2026-08-06T17:07:55.576413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.673066Z","title":null,"venue":null,"work_id":"3ac81d11-da25-4835-830d-e068223d36bc","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.707881Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:5150320dcc2b8a84e5b5bae5beb4b238c20769bffdfb13eb84e6e1b89ab2aa09","observation_id":"f96db652-053a-411e-b546-c39eb88f723c","resolution":{"observed_at":"2026-08-06T17:07:55.747430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:53.924438Z","title":"In: 2019 IEEE/CVF Conference on Computer Vi sion and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.924438Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:c3699f65f09d16701521e7e46ff7c86f3042c21b332efc912c3f3ce638aaaa80","observation_id":"6b65e2db-c640-4bb8-8cb1-04bb8cdf930f","resolution":{"observed_at":"2026-08-06T17:07:53.924438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.350781Z","title":"I n: International Confer- ence on Document Analysis and Recognition","venue":null,"work_id":"39afe280-a7dc-4275-b596-eadc219f152d","year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.023790Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:baabe739c060e8097099fa2317eebe9b0cf9d717c2fa7504704f42b50bd75a68","observation_id":"e0075ca2-de6a-4548-8926-de07ac41acc3","resolution":{"observed_at":"2026-08-06T17:07:55.448109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.117543Z","title":"In: 2017 IEEE International Conference on Computer Vision (ICC V)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.117543Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:a4d5ef592528857e6411e0538014d863de9930c643c0ea6264f80e0c573ef564","observation_id":"41c2d7c5-b59b-4419-b8d9-31c5b137352a","resolution":{"observed_at":"2026-08-06T17:07:54.117543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.246311Z","title":"In: 2022 IEEE/CVF Conference on Computer Vision and Pattern Recogni tion (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.246311Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:cdac4b0601e8026a6e7d8e8bb050dcea04f78dfbb6759da1bd1bf6a1797bdb0e","observation_id":"60e6df6a-3035-4fc7-ae12-9fe0bf21b657","resolution":{"observed_at":"2026-08-06T17:07:54.246311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.339787Z","title":"In: Proceedings of the 26th ACM SIGKDD International Confer - ence on Knowledge Discovery & Data Mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.339787Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:5999014b4c76194b8e0951dc22a4c1148964af91bd36caf24716121d49b4afc9","observation_id":"45eb9f88-24a5-4f21-9c0a-c4f896218a83","resolution":{"observed_at":"2026-08-06T17:07:54.339787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.206449Z","title":"In: The E leventh International Conference on Learning Representations (2022)","venue":null,"work_id":"be2e6055-f9ee-45cf-a1bd-8ebcdd9a1de5","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.402782Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:760342ad9cdb67fcc4c83834dbbd0e1a06796e9991278473f2170c180ac8df97","observation_id":"1cf8540d-5b29-4241-8ae6-4ecb408f8a18","resolution":{"observed_at":"2026-08-06T17:07:55.243516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.12490."}