{"as_of":"2026-08-15T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b56f83b703e0343baacebb21e5a08f1e0662c65cdcd7c2d7fef7a3d401f519f4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:06:29.134201Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:18.047840Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:c0d9ee4e6b7eb9d26988e23a656ac2c461fa48042e28fad2d648561a7e99b9b7","observation_id":"c16c13f3-b74c-486a-8ff6-11fc527d18b9","resolution":{"observed_at":"2026-05-17T20:33:26.875269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-10T22:17:27.900588Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.900588Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ea86b3e13e44acb277881180ada938f8725afad34f4c640ca7ab39eda494378b","observation_id":"cbbfbcab-553b-455a-a67e-1aded7501099","resolution":{"observed_at":"2026-08-10T22:17:27.900588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:46e2cbc321d91f724384139621723e7bb46e35ec4e97b12ec161b6ac3a2737c6","observation_id":"81917d7c-899a-4039-8374-d040546404e5","resolution":{"observed_at":"2026-05-22T19:52:01.886765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-08-13T17:51:12.532194Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:db54830f406d6c2b2b095f417db10875d823e6b7e52310935056a19c0f304ebb","observation_id":"27d21c87-cfb0-4cf0-9ce8-3a1f3b7b226f","resolution":{"observed_at":"2026-05-22T14:21:39.835811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-15T17:06:29.134201Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17398","last_updated":"2025-08-24T15:11:44Z","snapshot_observed_at":"2026-08-15T17:02:06.545927Z","submitted_at":"2025-08-24T15:11:44Z","title":"DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:06:29.134201Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2508.17398"},"observation_digest":"sha256:a24deb28b9ab149cc0af0b46fb330b4433915b0cca91b98fd37cb719feb2ae35","observation_id":"d09eb8ac-c8c5-4696-843b-113df3a1bb06","resolution":{"observed_at":"2026-08-15T17:06:29.134201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-04T08:15:55.113951Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-13T02:25:37.938690Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:55.113951Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:942e157182f9eb912e03d67eff96f9b5f856f409f2f8d68e2fa707a378b4797d","observation_id":"ec357329-5c77-4802-9e4d-91fd25aa5219","resolution":{"observed_at":"2026-08-04T08:15:55.113951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-03T12:06:36.929511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.04498","last_updated":"2026-06-08T02:50:24Z","snapshot_observed_at":"2026-08-04T01:49:38.336615Z","submitted_at":"2026-01-08T02:06:53Z","title":"IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T12:06:36.929511Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2601.04498"},"observation_digest":"sha256:2476607601c3f8294c297148c52367584c17d258d83c2c0af14d7dbd4f654947","observation_id":"dc315a0f-de32-4254-b33f-c504ef33e642","resolution":{"observed_at":"2026-08-03T12:06:36.929511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:eba8c132adfccbc4a091d68e31ca3f91e7b28a509c8363dae23cab2dbe1010db","observation_id":"1a8f2ebf-1202-40bd-8ece-d5a17c6b85cd","resolution":{"observed_at":"2026-05-10T16:09:05.339546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-02T19:41:33.549591Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:33.549591Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:67230cca269465b5b976e556b39944308be4ebd9c045cc4413306fb9dd719e3d","observation_id":"060bf5c0-ab02-4e9d-8812-72eed8a0eecd","resolution":{"observed_at":"2026-08-02T19:41:33.549591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.03157","last_updated":"2026-04-03T16:28:03Z","snapshot_observed_at":"2026-08-11T16:39:26.200882Z","submitted_at":"2026-04-03T16:28:03Z","title":"Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T20:02:44.124502Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.03157"},"observation_digest":"sha256:f0bdf742a842cdb7bf824c0500ebb4589fada3b1fa50bfe5ccce666221f5d462","observation_id":"6977d310-e376-4565-881f-16f8d8fec6cc","resolution":{"observed_at":"2026-05-13T20:03:12.121069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.08212","last_updated":"2026-04-09T13:11:30Z","snapshot_observed_at":"2026-08-15T03:03:20.099914Z","submitted_at":"2026-04-09T13:11:30Z","title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:39.410040Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.08212"},"observation_digest":"sha256:82b691167a11864c9a612f16f2c5ee36803eca0ef4690724567e1eddf8edd598","observation_id":"3a7fc88e-2bdf-4c7c-ab6e-45ca67073d3d","resolution":{"observed_at":"2026-05-11T06:41:22.806700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-08-11T03:43:39.621933Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:853a464b948b6b1cde825cd3933b27d611bd0b2f3d52a9cf8b2a0f1627e101b2","observation_id":"a517b7d4-85fb-4cae-84c7-cb1cc995c878","resolution":{"observed_at":"2026-05-11T07:16:10.969368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.03410","last_updated":"2026-06-02T09:54:03Z","snapshot_observed_at":"2026-08-15T06:56:00.675939Z","submitted_at":"2026-06-02T09:54:03Z","title":"Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:51.980559Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.03410"},"observation_digest":"sha256:637cfa1c225f0d59586acc5cf5d5ede320ac020dd1b48f695b18527c444a4780","observation_id":"b10619f3-6942-44e7-afb2-1f900912b75c","resolution":{"observed_at":"2026-07-02T02:26:26.239047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.17118","last_updated":"2026-06-15T10:59:11Z","snapshot_observed_at":"2026-08-01T22:00:49.016479Z","submitted_at":"2026-06-15T10:59:11Z","title":"MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T04:32:04.918645Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.17118"},"observation_digest":"sha256:8cb73e3f99a276360164fa656653b126c428cf83773e433e866323132c7fac6f","observation_id":"2a552759-cfe3-49c6-a22b-78088ce85eb0","resolution":{"observed_at":"2026-07-03T17:08:43.719131Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-15T04:37:27.117254Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:4a3d41107c77db5ffa9b5df1e18592b437dc61774a8c10012b39e91b9622c55f","observation_id":"5a9c32be-0c02-4617-93f7-9729fd6f1cfb","resolution":{"observed_at":"2026-07-04T00:49:18.049881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:722c4370ce18ff8a845bd5be9a8770c6932e01114a47bff0777e4d87a1587c41","observation_id":"c35469fc-3a31-4e53-a0a4-01e99de5bbe6","resolution":{"observed_at":"2026-07-03T14:48:32.359688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-31T06:20:14.121564Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-15T01:08:05.619745Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:14.121564Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:3841145c840c5ce06719a3bc6493693eb825e3213f1463d76e9d0d20cf28d39f","observation_id":"42c284ec-8a14-49c4-8d1a-f6c3308df46d","resolution":{"observed_at":"2026-07-31T06:20:14.121564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.12756/citation-record","integrity":"/paper/2104.12756/integrity","json":"/paper/2104.12756/citation-record.json","paper":"/paper/2104.12756"},"outbound":[],"paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2104.12756."}