{"as_of":"2026-08-11T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f8e0a9c7222e2d315dbabba555d16ba32e8f5e12a6179effb63297995da26b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:36:38.400017Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.866746Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:1228a34722af28ed3812b54f6aabd97c03f46d61f6c80ccb940d4a28de0abb48","observation_id":"9c3355a9-bca8-4cc7-8895-0fa71688eca1","resolution":{"observed_at":"2026-05-11T02:44:53.634793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:ab86f498cb57b3edadc80e52b1480230984eb15a8c4bd6dea9e6ecb44ebae20e","observation_id":"f56fd9f8-008a-434e-98bf-c4f74ea804ec","resolution":{"observed_at":"2026-05-17T21:08:19.785427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:431aab3f3730660facb82e06e7f601fbbbc46fdc840f3dbc19e42dc681c7b972","observation_id":"d6b5824c-d880-4145-867f-cfec6ee61f70","resolution":{"observed_at":"2026-05-11T01:20:00.157256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-10T04:36:38.400017Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-10T18:54:42.949169Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":288,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:38.400017Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:12b0490a42913b54d260807bffaba219ef5a00aa1f75d9caaa25d8c41a2b2ab0","observation_id":"f94a6481-4a61-4a81-821d-9751a9d44c09","resolution":{"observed_at":"2026-08-10T04:36:38.400017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:2ab00aa0e149b44b2e7b113c96e6395797c3cef79c999eb068a43649cbdfda46","observation_id":"bf0cfcfd-0c56-4fce-a101-93c74b334982","resolution":{"observed_at":"2026-05-12T09:43:00.428279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T15:19:14.093875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-10T17:14:45.967006Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.093875Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:83d3273ba262cbb100da509853057658bd7b8869662e9c50c8cc86656687ee54","observation_id":"9e79c0e2-fdf6-45ea-910e-0fcd9692b7ae","resolution":{"observed_at":"2026-08-07T15:19:14.093875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T12:22:12.360528Z","title":"Audio-visual llm for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-11T10:44:12.276130Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:12.360528Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:d3cf56ea4ee9d473dc459fb2884de0c952dc302c8c634783ce268421a901cde1","observation_id":"868cd186-217e-47e2-9345-540ad555343e","resolution":{"observed_at":"2026-08-07T12:22:12.360528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T11:50:44.668965Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01319","last_updated":"2025-06-02T05:02:03Z","snapshot_observed_at":"2026-08-11T00:55:37.690140Z","submitted_at":"2025-06-02T05:02:03Z","title":"Learning Sparsity for Effective and Efficient Music Performance Question Answering","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:44.668965Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.01319"},"observation_digest":"sha256:36c32bcf15370fe085a8001e7e117724938336c675652dd25f39e7f808105ce7","observation_id":"7782f6bc-cd96-4608-a112-e0cc68e74532","resolution":{"observed_at":"2026-08-07T11:50:44.668965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T13:26:50.104456Z","title":"Audio-visual LLM for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-10T07:32:55.066681Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.104456Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:7721cf2cc2081c8e48f7e981a92527c2b66ef7992546f6d236a1a528352eb0de","observation_id":"0117793b-5de8-4a38-8bf8-8c9c07a7b2ee","resolution":{"observed_at":"2026-08-07T13:26:50.104456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T05:05:50.794819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.794819Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:fb5feff914e431aad70e3d06f55f7165919f6ec52830dbb48a69a9e5fc3a5cf5","observation_id":"9b435fac-ba84-4bce-a64c-509e62ab856b","resolution":{"observed_at":"2026-08-07T05:05:50.794819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T21:23:45.751588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00286","last_updated":"2025-07-19T04:31:05Z","snapshot_observed_at":"2026-08-09T16:11:59.852302Z","submitted_at":"2025-06-30T21:55:21Z","title":"\"Before, I Asked My Mom, Now I Ask ChatGPT\": Visual Privacy Management with Generative AI for Blind and Low-Vision People","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.751588Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.00286"},"observation_digest":"sha256:30bc3f9c1b2f39360be3b25f5c081757c51ed200d2e713f74101a9758f204afe","observation_id":"3c1bf8c1-3523-453a-9fb7-56d662b584e5","resolution":{"observed_at":"2026-08-06T21:23:45.751588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T14:36:29.216841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.216841Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f3aec34b20b9a6cc93ea5d72528baf9edcaab3a6d3d6aa0d410beff7dad3d606","observation_id":"bc1ed0eb-b562-42ae-a323-31a5a96752f1","resolution":{"observed_at":"2026-08-06T14:36:29.216841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T13:12:40.249511Z","title":"Audio-visual llm for video understanding.arXiv preprint arXiv:2312.06720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.249511Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:fbe87d2768673784d975e63aa8db7605fa3f306bd84386acc60e1e7f0335e2d2","observation_id":"b4a0a645-4785-4ba4-a8bd-573947db35c1","resolution":{"observed_at":"2026-08-06T13:12:40.249511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2510.18346","last_updated":"2026-07-10T08:37:10Z","snapshot_observed_at":"2026-08-08T06:26:13.235254Z","submitted_at":"2025-10-21T06:58:34Z","title":"AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T05:26:07.722390Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2510.18346"},"observation_digest":"sha256:c07da604d35a0152adcb28b419073bf7233d0439ad2dce04c24d79cc038c0668","observation_id":"0a5b208f-05a0-45e2-9930-fc1c196af9fd","resolution":{"observed_at":"2026-05-18T05:30:55.403906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-04T08:55:26.153084Z","title":"Audio-visual llm for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18346","last_updated":"2026-07-10T08:37:10Z","snapshot_observed_at":"2026-08-08T06:26:13.235254Z","submitted_at":"2025-10-21T06:58:34Z","title":"AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T08:55:26.153084Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2510.18346"},"observation_digest":"sha256:91d515e78fcdfa573f9e7d1658a22423e96e9aadbd0d9d1be71fd5c2bb96725c","observation_id":"52e6c9c0-0ce5-47fc-96f6-0e6a2b0a3fb1","resolution":{"observed_at":"2026-08-04T08:55:26.153084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":"2312.06720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-07-03T04:27:36.866746Z","title":"Audio-visual llm for video understanding","venue":null,"work_id":"f81c01aa-202a-4445-b365-2cc2b4e44a43","year":2023},"citing_paper":{"arxiv_id":"2606.10533","last_updated":"2026-06-09T08:04:06Z","snapshot_observed_at":"2026-08-05T15:31:34.855440Z","submitted_at":"2026-06-09T08:04:06Z","title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:53:53.520545Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2606.10533"},"observation_digest":"sha256:93d33c7cc987e9517fec8397bfebb001a33fb9f7affe85654514bd872e9efc99","observation_id":"e99330e2-0e58-43c7-a6f6-f913315cf8e1","resolution":{"observed_at":"2026-07-03T04:27:36.868245Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06720/citation-record","integrity":"/paper/2312.06720/integrity","json":"/paper/2312.06720/citation-record.json","paper":"/paper/2312.06720"},"outbound":[],"paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2312.06720."}