{"as_of":"2026-08-10T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d83ed8661f5b57eb7aa477b90fd11c3afb4ffa406ee5cf4004b6f0180c3c21d2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:22:10.238771Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-08T18:22:10.238771Z","title":"A Review of Multi- Modal Large Language and Vision Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05701","last_updated":"2025-02-08T21:42:14Z","snapshot_observed_at":"2026-08-09T13:30:33.268431Z","submitted_at":"2025-02-08T21:42:14Z","title":"TOKON: TOKenization-Optimized Normalization for time series analysis with a large language model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:22:10.238771Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2502.05701"},"observation_digest":"sha256:051c7d3f9085b61cec40b95a77fa8a70c37b12a2f3fb5a8b916e68aaf5a52076","observation_id":"08e50ad5-4808-4a8c-8b16-f3d5365b226e","resolution":{"observed_at":"2026-08-08T18:22:10.238771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-07T05:36:15.479733Z","title":"A review of multi-modal large language and vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-08T12:50:28.189950Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.479733Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:8bf784f9dc90246d7491fb24e607eca07674a4236a85ad491a0c2be07a0c1c78","observation_id":"71f318e2-1579-4182-b768-4d14b299a69d","resolution":{"observed_at":"2026-08-07T05:36:15.479733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-07T00:41:41.097111Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13038","last_updated":"2025-06-17T14:31:50Z","snapshot_observed_at":"2026-08-09T13:30:06.420632Z","submitted_at":"2025-06-16T02:03:41Z","title":"HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:41.097111Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2506.13038"},"observation_digest":"sha256:555bc971d194b9856078be8111c746031e322b632a3f806cbf19ad45a64f9edd","observation_id":"9830cf20-e016-45ed-bdd3-d6c84b3cfadd","resolution":{"observed_at":"2026-08-07T00:41:41.097111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T11:48:43.288927Z","title":"arXiv preprint arXiv:2404.01322 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02241","last_updated":"2025-09-02T12:09:49Z","snapshot_observed_at":"2026-08-09T17:42:44.908227Z","submitted_at":"2025-09-02T12:09:49Z","title":"LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:48:43.288927Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2509.02241"},"observation_digest":"sha256:71cc4445d4e6197fc6cab5fb5300717a07b16e01d943798648934c04a402e491","observation_id":"473f1fd4-803c-41fd-8dc1-524eea4a2891","resolution":{"observed_at":"2026-08-05T11:48:43.288927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-04T12:55:35.364167Z","title":"A review of multi-modal large language and vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.364167Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2e391a5eade336343836f9de955db0acbc377ca364f2cdb115cc8bfee6450f7c","observation_id":"a4878e1b-08ea-4c31-b93e-a8c591c66d13","resolution":{"observed_at":"2026-08-04T12:55:35.364167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2604.20190","last_updated":"2026-04-22T05:11:02Z","snapshot_observed_at":"2026-07-31T09:36:22.924731Z","submitted_at":"2026-04-22T05:11:02Z","title":"WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:08:34.674972Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2604.20190"},"observation_digest":"sha256:8ad1a1f675aecafb6f41286eb6e10440b2446d0862390d79156acc0b58c0fff3","observation_id":"bf1612b3-304e-483a-84bf-ea8147f3fb1d","resolution":{"observed_at":"2026-05-10T01:10:09.177122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.01938","last_updated":"2026-05-03T15:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-03T15:36:42Z","title":"Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T15:58:52.425995Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.01938"},"observation_digest":"sha256:16b64e204838295a8228e7dcf2cceb0cef8cd7e1fc0bfa433d1aa927e9f95e59","observation_id":"b10e73ee-6c9e-4744-9d6e-7b6a957cd787","resolution":{"observed_at":"2026-05-11T16:36:08.685148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.01938","last_updated":"2026-05-03T15:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-03T15:36:42Z","title":"Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:58:52.425995Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.01938"},"observation_digest":"sha256:cc4758cf0a95ac26ac7c875bf9d66ea85096ef31f4441dcfb4f0c4549f3ed6c8","observation_id":"ef9fd723-9775-4162-b6dd-aa42fe10423c","resolution":{"observed_at":"2026-05-09T21:58:47.248139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.27920","last_updated":"2026-05-27T03:47:05Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:47:05Z","title":"Rethinking Video-Language Model from the Language Input Perspective","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T13:24:46.360149Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.27920"},"observation_digest":"sha256:f765932609c5a4e3b645403d3cf5cf99f722cc2b4ddcaee2fc19938dd305ed58","observation_id":"57d959cc-61c0-4e1c-9a52-f17246a94efe","resolution":{"observed_at":"2026-06-29T13:33:28.475273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01322/citation-record","integrity":"/paper/2404.01322/integrity","json":"/paper/2404.01322/citation-record.json","paper":"/paper/2404.01322"},"outbound":[],"paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2404.01322."}