{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31cae756753ba32d999b5ecac7a8058c3dc2743e726d882d59d32ddb02f10561","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:11.856611Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:36:29.321068Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:61647629f4b867c4a2d39c9ac01d55b40c557120f49cfa91ff207f7f200e9619","observation_id":"faf09f6d-4f16-4a6c-8a93-5ef9b397e69e","resolution":{"observed_at":"2026-05-15T17:18:53.755858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T14:42:56.565621Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2505.14362"},"observation_digest":"sha256:08322ebb001f59e934b00f9cb7f84f51290ac40cd6ea62fb0c3515a4c453831f","observation_id":"38fc3d37-2127-4eb3-a83a-f32fb43120d9","resolution":{"observed_at":"2026-05-11T14:42:56.692480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T08:38:02.944230Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2505.17015"},"observation_digest":"sha256:caf357353cdd108e22779930317761fae231d985fb8b7e7f7b99ce7056d91895","observation_id":"0efdf565-d8a1-4c28-8a44-98498760094c","resolution":{"observed_at":"2026-05-25T08:40:33.070174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T11:55:11.856611Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.856611Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:dd80ca924794bea3e79a15b13cf4a88be4f94be4b51343b9d370b825f42cbe86","observation_id":"38f64302-aa0c-470f-99a1-8791e16daa41","resolution":{"observed_at":"2026-08-07T11:55:11.856611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T10:41:26.797359Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.797359Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fc205d203447f5830f0100bc4186ebf91b061aac6246195eeee283dfc13a578a","observation_id":"c4bcaab8-ae48-4db9-ab60-0dfbb21133f0","resolution":{"observed_at":"2026-08-07T10:41:26.797359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-05T12:27:04.877627Z","title":"Perception tokens enhance visual reasoning in multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-09T16:17:17.533156Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.877627Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:77a30cce23baf055229216fa6a6fcb32623d6062e10d95ee6436bd8238e0acc8","observation_id":"9cfda28d-3101-4897-bb86-cda98321c705","resolution":{"observed_at":"2026-08-05T12:27:04.877627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-03T00:00:10.613016Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:94b9f749f9c927f21549b272358d8557bdee4269f7deba8b99b6d5ae55abba45","observation_id":"ba36fc91-b07d-4dfb-ab52-00c26823f393","resolution":{"observed_at":"2026-05-12T03:26:19.617713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":"2412.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-07-02T03:36:29.321068Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"ba107ef9-edff-400a-882e-399c7858704f","year":2024},"citing_paper":{"arxiv_id":"2606.03988","last_updated":"2026-06-03T04:16:22Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:59:17Z","title":"Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T09:56:05.047862Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2606.03988"},"observation_digest":"sha256:3d0928fcad3748c74b647675fd62bf2d3b21fa8ee7019acc51f20aa70270b03c","observation_id":"e3344295-1764-4060-b955-552c45fd8ff8","resolution":{"observed_at":"2026-07-02T03:36:29.323266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-06T00:25:21.143352Z","title":"Perception tokens enhance visual reasoning in multimodal language mod- els.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01297","last_updated":"2026-08-02T15:06:15Z","snapshot_observed_at":"2026-08-09T11:46:19.387708Z","submitted_at":"2026-08-02T15:06:15Z","title":"Data augmentation as a framework for modeling hippocampal contributions to generalization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:25:21.143352Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2608.01297"},"observation_digest":"sha256:bdc177f50d9f4c64e2c5af0a1b1b77a9e4a26a54bde2ccd23b841de9c7bcd47f","observation_id":"6f931824-020f-4dcc-a548-06bb9e63a773","resolution":{"observed_at":"2026-08-06T00:25:21.143352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03548/citation-record","integrity":"/paper/2412.03548/integrity","json":"/paper/2412.03548/citation-record.json","paper":"/paper/2412.03548"},"outbound":[],"paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2412.03548."}