{"as_of":"2026-08-15T18:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:318901016f32fc6be1ca196d0a6d34833304c4133c9e19010855365e2a2e8234","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:08:40.534320Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.18527/citation-record","integrity":"/paper/2602.18527/integrity","json":"/paper/2602.18527/citation-record.json","paper":"/paper/2602.18527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-15T14:34:38.180262Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-02T22:08:39.759563Z","title":"Grounded 3d-LLM with referent tokens.arXiv preprint arXiv:2405.10370, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.759563Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:5cc2a3cfe395b64d7476323222fc6b408f7e085328030aec6245d3f73249546a","observation_id":"a94c27af-931a-4fff-bf49-86ccdf60e939","resolution":{"observed_at":"2026-08-02T22:08:39.759563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:08:40.139307Z","title":"video-SALMONN 2: Captioning- enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:40.139307Z"},"links":{"citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:c2bad2f7de1b19c3cc7783a5375b4d756fa1cedfaaf6cd4f6a015fd1386f16eb","observation_id":"46e24356-6c6d-4f8f-a228-c091bdbfdbd2","resolution":{"observed_at":"2026-08-02T22:08:40.139307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:08:40.268567Z","title":"N3D-VLM: Native 3D ground- ing enables accurate spatial reasoning in vision-language models.arXiv preprint arXiv:2512.16561,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:40.268567Z"},"links":{"citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:3e26c94eebf594377d60acff52ffa8849d536c06e690411e8670a04081fbfc06","observation_id":"1a2f57f0-45d7-4771-bc89-eca22ec1c847","resolution":{"observed_at":"2026-08-02T22:08:40.268567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-02T22:08:40.395661Z","title":"Qwen2.5-Omni techni- cal report.arXiv preprint arXiv:2503.20215, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:40.395661Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:588900aff07ec36907a684c325df1452a95f8f78c649633c72da4dffa13380d3","observation_id":"c40a3b6a-1571-430d-8a5a-b23d10798b52","resolution":{"observed_at":"2026-08-02T22:08:40.395661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-02T22:08:40.534320Z","title":"floor standing speaker","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:40.534320Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:a16613e28e5e999654481366b1a741479c3e74224024bf22371282b319f4e9e5","observation_id":"7736e1c7-74bc-459d-84f9-2d0ce48969e2","resolution":{"observed_at":"2026-08-02T22:08:40.534320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-15T04:16:11.827389Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-02T22:08:40.003799Z","title":"GPT4Scene: Understand 3D scenes from videos with vision-language models.arXiv preprint arXiv:2501.01428,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:40.003799Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:72966878445a471f35dbb141cb645e05b627498a1d38878e74b01fc82f294542","observation_id":"48b73ff5-a861-434c-9f81-a910cb1ca327","resolution":{"observed_at":"2026-08-02T22:08:40.003799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:08:39.581432Z","title":"SpatialVLM: Endowing vision- language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.581432Z"},"links":{"citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:f6271e2f99f1feb4287a6d31dffb9d497aedfd000b56d6651111aefee60be333","observation_id":"ff301b4e-f09b-4ef5-a34b-8ce43bfdbda7","resolution":{"observed_at":"2026-08-02T22:08:39.581432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T22:08:39.292349Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.292349Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:a096c35b724317794061dbaf144c751abf5d35864ed4d3f3c939143f4e94aabd","observation_id":"66a0e07c-dd83-4b94-9929-b405c103bbd6","resolution":{"observed_at":"2026-08-02T22:08:39.292349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T22:08:39.921774Z","title":"Seed1.5-VL technical report.arXiv preprint arXiv:2505.07062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.921774Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:99709afe3ebb2156beedf9808262c1fdb72191d54b1c0d9f66e95cb2f7f33fbc","observation_id":"70193c6f-cc14-436f-8edf-b32e7c284204","resolution":{"observed_at":"2026-08-02T22:08:39.921774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:08:39.399844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.399844Z"},"links":{"citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:762bfbbc79d17dc00030ac463014043b5166fe186706ccc2d3bb2deb98165ff1","observation_id":"dd0715a1-8cf8-433d-adc8-c8cf6fa447ab","resolution":{"observed_at":"2026-08-02T22:08:39.399844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2602.18527."}