{"as_of":"2026-08-09T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62e9095c73ef0c123e20a6088479f82205b680c21da296c768ab2324440adb81","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:11.527741Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:45:00.682859Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T15:15:11.527741Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate.arXiv preprint arXiv:2410.07167,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-09T05:46:26.896787Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:11.527741Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:11eee28b641755e783c23b70b9a4e4d4a7e4cc0797ba6f7e8121393c0db5937e","observation_id":"d6970a0a-68eb-4b8b-8841-49d7ff231925","resolution":{"observed_at":"2026-08-07T15:15:11.527741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T14:52:07.553797Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.553797Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:89feb395036c119f39725ade89fd2673c92c7bc0dd339adfc2a1f397c0e3f523","observation_id":"afd9b67a-ee7f-4db6-a5d8-cecc6819e3b2","resolution":{"observed_at":"2026-08-07T14:52:07.553797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T12:37:20.984510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-08T01:25:52.362186Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.984510Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:18ce6949ef86b915c40a6aca4aacbc569e476d9784d84ae5600411846b42d2d7","observation_id":"c11fcb7d-a043-4238-9988-5fe90ad14551","resolution":{"observed_at":"2026-08-07T12:37:20.984510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-05T16:32:42.939167Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-08T14:52:11.957792Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.939167Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:311a33257a80678165990372a267b096414a19a07fbfd4ecc3a068ce9572ffec","observation_id":"ea38c2f4-6165-4719-8c34-37e37b7bb1a4","resolution":{"observed_at":"2026-08-05T16:32:42.939167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:16.012419Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:7e9f7f454b62e556b469f3fde05872f22bb186b5c44abf415b0717562d00abb8","observation_id":"37d341dd-0cd8-44ac-9657-7fd031ebfc28","resolution":{"observed_at":"2026-05-20T13:33:19.172520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T19:42:41.238072Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:f0e5f56637e1605754f25ac79179411dc43e2322d335a4bef9f6f5f4e00a6139","observation_id":"06f3f885-7a39-4372-90a5-42c8deca1fbc","resolution":{"observed_at":"2026-06-30T19:45:00.684556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.30265","last_updated":"2026-05-28T17:27:55Z","snapshot_observed_at":"2026-08-01T22:14:47.638279Z","submitted_at":"2026-05-28T17:27:55Z","title":"LoMo: Local Modality Substitution for Deeper Vision-Language Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:20:05.081980Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.30265"},"observation_digest":"sha256:fc469e417aee9195f7603927e24b8f8b93b046c7c999525a348d42070699a595","observation_id":"eed17356-21fa-4a12-90e4-9976229c8bf9","resolution":{"observed_at":"2026-06-29T08:23:15.119706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.07167/citation-record","integrity":"/paper/2410.07167/integrity","json":"/paper/2410.07167/citation-record.json","paper":"/paper/2410.07167"},"outbound":[],"paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2410.07167."}