{"as_of":"2026-08-09T08:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fca624bab9b1f46693998ec09a0119b9b0e548aa1e6304cc79a4085938661be","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:26:35.545652Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:52:13.947049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:51:02.625990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06445","snapshot_observed_at":"2026-08-05T10:52:13.947049Z","title":"Benchmarking Vision-Language Models on Optical Char- acter Recognition in Dynamic Video Environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03615","last_updated":"2025-09-03T18:08:41Z","snapshot_observed_at":"2026-08-06T15:56:57.359517Z","submitted_at":"2025-09-03T18:08:41Z","title":"E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:13.947049Z"},"links":{"cited_paper":"/paper/2502.06445","citing_paper":"/paper/2509.03615"},"observation_digest":"sha256:15271c6dd4d62f904d9d40831f63d0cc107fd11c9f9d4fa73bc29604b5228242","observation_id":"0e34a902-f194-46ac-b30e-8a3c051e7050","resolution":{"observed_at":"2026-08-05T10:52:13.947049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"cited_work":{"arxiv_id":"2502.06445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06445","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking vision-language models on optical character recognition in dynamic video environments","venue":null,"work_id":"7385da35-0b15-48c3-85f2-9d543835f751","year":2025},"citing_paper":{"arxiv_id":"2604.19844","last_updated":"2026-04-21T11:27:30Z","snapshot_observed_at":"2026-07-31T22:27:19.281459Z","submitted_at":"2026-04-21T11:27:30Z","title":"If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:54:35.336251Z"},"links":{"cited_paper":"/paper/2502.06445","citing_paper":"/paper/2604.19844"},"observation_digest":"sha256:4cf2430a3ed3e5d9ec7a1fa7be8f788097c0bcb237954150cdde442a3e5c43f9","observation_id":"4723749e-4596-4773-9479-2819028e83d0","resolution":{"observed_at":"2026-05-11T12:51:02.632753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06445/citation-record","integrity":"/paper/2502.06445/integrity","json":"/paper/2502.06445/citation-record.json","paper":"/paper/2502.06445"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.700646Z","title":"Claude 3.5 Sonnet: Advancements in multimodal AI, 2024","venue":null,"work_id":"32ebc91c-5a2b-4687-989f-269bf4c803eb","year":2024},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.497443Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:88152932b3e0893a1aaef7a13c85fb1cd01c4c400f7f404fb48e71f98ddef204","observation_id":"0a3b1be0-97aa-43ec-80f3-e5d331418088","resolution":{"observed_at":"2026-08-08T15:26:35.704519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.690128Z","title":"Character region awareness for text detection","venue":null,"work_id":"3b25fcac-ffdd-4e09-8d04-d8019ae74ad2","year":2019},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.501446Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:4396ec9a8eca317e00e6b095bd80b5237f6469909bce39d2e9f27e4ad529d82a","observation_id":"1046109f-197b-4a05-8f89-d21b56d4f058","resolution":{"observed_at":"2026-08-08T15:26:35.693817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04764","last_updated":"2025-01-08T18:35:48Z","snapshot_observed_at":"2026-08-09T06:37:33.753187Z","submitted_at":"2025-01-08T18:35:48Z","title":"Video Summarisation with Incident and Context Information using Generative AI","version":1},"cited_work":{"arxiv_id":"2501.04764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04764","snapshot_observed_at":"2026-08-08T15:26:35.594856Z","title":"Video Summarisation with Incident and Context Information using Generative AI","venue":"cs.CV","work_id":"6ce9194d-7eda-46e6-b024-4e70e781b09b","year":2025},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.504918Z"},"links":{"cited_paper":"/paper/2501.04764","citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:e5aefd7dba37cbfd0d284152b31142aaaa83d5c22e51ef51b84d55bdaa30f73d","observation_id":"c2ee93df-3d7b-4fad-812f-465de9584b6b","resolution":{"observed_at":"2026-08-08T15:26:35.600757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.679700Z","title":"Gemini 1.5 Pro: Pushing the boundaries of multimodal learning, 2024","venue":null,"work_id":"1ef8ee7f-d8af-4aba-b625-98cc38b4e707","year":2024},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.509583Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:6211cce9b4c295e5e743ac6bd631d714f09ba05b6753ec546939b5d4c9305500","observation_id":"eb881b5c-62a1-4c78-ac48-9438e8c4ecc6","resolution":{"observed_at":"2026-08-08T15:26:35.683494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.669421Z","title":"Connectionist temporal classification.Supervised sequence labelling with recurrent neural networks, pages 61–93, 2012","venue":null,"work_id":"062c0f1e-3394-43de-af3f-7e2817574174","year":2012},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.514088Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:feb23c21507423b45982f7886bba70bee492ecd2e365843947352d7a6db69ab5","observation_id":"3f030ddb-1ba6-4207-a14d-5a2623b60c58","resolution":{"observed_at":"2026-08-08T15:26:35.673053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.659118Z","title":"EasyOCR: Ready-to-use OCR with 80+ supported languages, 2024","venue":null,"work_id":"074b9aca-4ff3-4b7d-90a5-546cfe3cbc7d","year":2024},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.518254Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:3c0925af417d72f76c0ecaf277c64937a893ff7b972e6e9fe2c11a32606e2ec7","observation_id":"a6ab84df-6e34-4b81-976a-17b880e340ba","resolution":{"observed_at":"2026-08-08T15:26:35.662730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07112","last_updated":"2024-10-24T05:17:36Z","snapshot_observed_at":"2026-08-09T06:36:37.931027Z","submitted_at":"2024-10-09T17:46:34Z","title":"VHELM: A Holistic Evaluation of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07112","snapshot_observed_at":"2026-08-08T15:26:35.522585Z","title":"Vhelm: A holistic evaluation of vision language models.arXiv preprint arXiv:2410.07112, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.522585Z"},"links":{"cited_paper":"/paper/2410.07112","citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:17f06f363ba14d64402d5e81e4b11a53510821c0d814233e9b8580899b1c8dfc","observation_id":"b51d91ee-3fde-434a-b2b1-f991fcf894e0","resolution":{"observed_at":"2026-08-08T15:26:35.522585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-08T15:26:35.526768Z","title":"Tvqa: Localized, compositional video question answering.arXiv preprint arXiv:1809.01696, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.526768Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:b557b87e052328aa8d8d85fba3fbdd159e2a4c3252e683b1d3fbeec4cd4bb5c1","observation_id":"d3e7a6cb-a8d5-4fa7-9907-7ae932fecda9","resolution":{"observed_at":"2026-08-08T15:26:35.526768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.648043Z","title":"GPT-4o: Omni-modal language model, 2024","venue":null,"work_id":"8c48fb51-5d25-46ad-8271-16cc771cb071","year":2024},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.530884Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:6e5995d5f966216a735a567348746379cfe313242686693d0816f4a42398ffc1","observation_id":"516c8911-650f-42e8-8ff9-98f89b5a6e0a","resolution":{"observed_at":"2026-08-08T15:26:35.651666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.637755Z","title":"PaddleOCR: An OCR toolset based on PaddlePaddle, 2023","venue":null,"work_id":"c8e245ef-99f0-458f-9bac-13e26ef92a54","year":2023},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.534603Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:a6b6d20a728f64094aa851762283ef4fd94f069bd95d10e7b871ebb730dad74f","observation_id":"43496147-274f-406b-9bc9-9ecfa6285dcb","resolution":{"observed_at":"2026-08-08T15:26:35.641320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.628282Z","title":"RapidOCR: A lightweight OCR framework, 2021","venue":null,"work_id":"52aac934-366a-4626-9be3-5990f85e7692","year":2021},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.538170Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:7eda6306494ccf1512dc370ed8174662eea10f45eb5289f2cafa03b16f50c395","observation_id":"214282ec-339f-4b66-a61f-8a46125e10e7","resolution":{"observed_at":"2026-08-08T15:26:35.631189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.618719Z","title":"VideoDB: Video infrastructure for the AI first world, 2024","venue":null,"work_id":"a0d11a93-4d1d-4855-84a9-bbb97472b04b","year":2024},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.542032Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:562a2e8aa2016c4ac26341efd001c459d995a494a3dd9b56a0631cac6c7ae1e6","observation_id":"bf814452-f886-4d36-b80e-f50f86e588f2","resolution":{"observed_at":"2026-08-08T15:26:35.621872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:26:35.609172Z","title":"CONTEXT\"? OF","venue":null,"work_id":"fa4802e8-bde7-49b2-8cf2-144964a08072","year":2016},"citing_paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:35.545652Z"},"links":{"citing_paper":"/paper/2502.06445"},"observation_digest":"sha256:280bf4632ed58bdd93e974729827f28e5fb9891678703edaaef4cd369bdf647f","observation_id":"baacb20c-5206-4603-bbe7-40ebcaaf3f32","resolution":{"observed_at":"2026-08-08T15:26:35.612278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06445","last_updated":"2025-02-10T13:20:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:36:59.592776Z","submitted_at":"2025-02-10T13:20:19Z","title":"Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 2 inbound Pith citation observations for arXiv:2502.06445."}