{"as_of":"2026-08-15T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a5ce0fec755c8ce8df01559f7e9eac1e7a751f8b74c0f5d13dcea01cdc3ad66","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:50:53.648115Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:39:22.070629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T23:45:08.222067Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-13T15:03:26.321098Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:230393895c0356247cfa679675c8c608341014b6c689b3bf80e95150cd621be8","observation_id":"ccdd4417-f720-4d73-a485-7bcd61c5b45d","resolution":{"observed_at":"2026-05-15T21:46:42.583892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:df88ba559b2dd86b05fa8d60e098b308cfbb7d9acf3a97dfb85a8e5a502a9abd","observation_id":"162511d4-657a-4d71-8e94-51887078ef76","resolution":{"observed_at":"2026-06-30T23:45:08.223574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-08-15T02:33:49.999981Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:ef6ae18c375d5d67013a2735fb3b88b8034b8213e7a1968c540c1cf7bd337908","observation_id":"1105d00a-a7c5-41f2-b56c-abe588f4d4b2","resolution":{"observed_at":"2026-05-20T10:13:11.900409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05414/citation-record","integrity":"/paper/2506.05414/integrity","json":"/paper/2506.05414/citation-record.json","paper":"/paper/2506.05414"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.213723Z","title":"Shelton and Timothy P","venue":null,"work_id":"0d71a8c2-3c7e-447d-bb9b-aff91b857202","year":2001},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.562058Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:69c0fa7a7bda21db3f19ff684195ffdb107eb7cf4f25429660388fb64ef141cd","observation_id":"51c70d91-d0d3-4485-9597-c4635738810b","resolution":{"observed_at":"2026-08-07T10:50:55.218328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.568788Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.568788Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:8dda0f6451401f6bd9c4330aef43bc14ee2dc6654b5a6f3359514991183ae4c7","observation_id":"54604aca-b920-4463-a66d-cc2af4ca5b7f","resolution":{"observed_at":"2026-08-07T10:50:52.568788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-14T22:29:28.847917Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:50:52.575432Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.575432Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:629973adede259940e31b6b2a186e2328fd461099172ea5ccaafece33a2d8dcf","observation_id":"8d839f7c-d13a-4593-8741-4824627e8516","resolution":{"observed_at":"2026-08-07T10:50:52.575432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.581847Z","title":"Tenenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio Torralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.581847Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:71f5b032f931ec62f5a3c79216d25a37a7c38c34d9c26a4e7984fa53b055c0d4","observation_id":"d9994da5-2214-47aa-967d-1499f0e1d1ef","resolution":{"observed_at":"2026-08-07T10:50:52.581847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-12T22:36:38.589325Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-07T10:50:52.588064Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.588064Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:996575aabb51b86cf300c9ab20eb88ba06def9446f88084385ed54dc09bf5f6d","observation_id":"7ab239f0-022e-42d6-bc5d-4a37fbd8672b","resolution":{"observed_at":"2026-08-07T10:50:52.588064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.596168Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.596168Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:716c6cf3516e3ce014f5d0f2a608c9819e83288e6acea26357918befad23ae7c","observation_id":"30493e97-6e53-4e79-89a1-589441b5d889","resolution":{"observed_at":"2026-08-07T10:50:52.596168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.603103Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.603103Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0202f243c7263e9075cf381839aa0f2ad1571398067abbfedfc016d02a38f0fb","observation_id":"c43455d5-fd59-416f-a947-1c9b60b35c83","resolution":{"observed_at":"2026-08-07T10:50:52.603103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.610231Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.610231Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:16eaa0fc8c6090da3e4af1368a73466a54cf1bff4fb5662aea8ccce125f92dd8","observation_id":"d85400df-0ead-4fef-bad4-b78914fb1e5b","resolution":{"observed_at":"2026-08-07T10:50:52.610231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.617297Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.617297Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:afac5fb503d840f86df9075d610b89584c79fdab0ae60350075219985040cbe1","observation_id":"a4d67649-81ae-4855-8570-07441948562b","resolution":{"observed_at":"2026-08-07T10:50:52.617297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.624322Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.624322Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:bf6b8a5c3e0cd4ab4a1e05dc1abd57a58408d0559bc91d526e64ac31b92602b8","observation_id":"e126f361-8d8a-4cd4-9614-0a94ea7d0776","resolution":{"observed_at":"2026-08-07T10:50:52.624322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T10:50:52.630717Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv preprint arXiv:2309.17421, 9(1):1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.630717Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:33c72d6574daa020f9d26cae2df3305c728719fff9126ad3aef7f39b74271560","observation_id":"5815ef23-37f8-41bd-a5f7-b5a5bbffcd90","resolution":{"observed_at":"2026-08-07T10:50:52.630717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:50:52.638441Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.638441Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:56182797aa52ede8c6d64e4a5adbf31d50118e7e600e9a32164119f7cdd31ed2","observation_id":"1b379fc0-4ef3-45e3-93b6-51201ac64726","resolution":{"observed_at":"2026-08-07T10:50:52.638441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:50:52.645520Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.645520Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:981ce900640bccd07281b2ce96dda2b3c3063c0598b105f9fa50535e550a04a2","observation_id":"d7856dab-999d-4b83-a02d-48a4ba13866f","resolution":{"observed_at":"2026-08-07T10:50:52.645520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T10:50:52.652513Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.652513Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:29a463d2acb6b24044c59906e5331142a12b8bed59135c8a270c3eb198bc2bf4","observation_id":"961cccdb-6df9-40ec-8327-66d0ad9ea2b4","resolution":{"observed_at":"2026-08-07T10:50:52.652513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:50:52.658655Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.658655Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:78f7f6f7ca613ba0a9a9dcd175fc227d44c39f71be6d4a5ca43663a8061cf639","observation_id":"64518349-8e1d-4ed3-8a5c-6eb46e3d765a","resolution":{"observed_at":"2026-08-07T10:50:52.658655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:50:52.664757Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.664757Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:14507beb80bf6341b0ce979e5bb1382e986ec0ae6d732745dc595d5290a87608","observation_id":"3d34628c-381a-41de-ae2a-00fadf19fe1e","resolution":{"observed_at":"2026-08-07T10:50:52.664757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T10:50:52.670777Z","title":"Listen, think, and understand.arXiv preprint arXiv:2305.10790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.670777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:9938bc4b4680772e6a86dbab48fd235d45f5190150a83fa041cf5eef4d4da708","observation_id":"b19e6aaa-7840-46aa-9110-6e641672ca3c","resolution":{"observed_at":"2026-08-07T10:50:52.670777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T10:50:52.677692Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.arXiv preprint arXiv:2311.07919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.677692Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:693563433cd6f244447510a4094e981f2348ec9a182c9c4d1a5215ec8f867d2c","observation_id":"fbef4dad-59d5-4be8-ba15-309b10b28eb1","resolution":{"observed_at":"2026-08-07T10:50:52.677692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-07T10:50:52.684460Z","title":"Kimi-audio technical report.arXiv preprint arXiv:2504.18425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.684460Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:9ab0e93662526aa23de23ab245b5d6442313b834e513dd115d92477098bac3cf","observation_id":"2f83e2ec-4967-4a44-8c46-197267c26a52","resolution":{"observed_at":"2026-08-07T10:50:52.684460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.130804Z","title":"Audio-reasoner: Improving reasoning capability in large audio language models, 2025","venue":null,"work_id":"66ee74d1-3d58-4011-801f-db537b0ac8ec","year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.691260Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:57aaffa0180396618190a8ed20cfd96759c65099741e1e4e724145ac367675f4","observation_id":"95790d61-6845-4e0e-9e17-22c7694b5a54","resolution":{"observed_at":"2026-08-07T10:50:55.135905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:50:52.698238Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.698238Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4c8e7f01951bf3dcd2496d4efb73a7e1e7a212b3d9de7b91606be9724a42e75c","observation_id":"f773e9ef-4b51-40a0-b55a-e8f37e6c6c5d","resolution":{"observed_at":"2026-08-07T10:50:52.698238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-08-12T14:43:22.247523Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19772","snapshot_observed_at":"2026-08-07T10:50:52.705026Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos.arXiv preprint arXiv:2411.19772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.705026Z"},"links":{"cited_paper":"/paper/2411.19772","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0f536c5e1d0f58b7e74a3e225e0b8d23a00c8c55d6783968f9812756ea410e3c","observation_id":"f5dcc519-42f4-4923-9c3a-02a13a5e89ac","resolution":{"observed_at":"2026-08-07T10:50:52.705026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.712377Z","title":"Egolife: Towards egocentric life assistant, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.712377Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0f4f8fa0724e8f5453eda407143875cae0514e694920d90f16e5f40f1e6feabf","observation_id":"1286094a-ef5e-48ac-9c06-67421896a221","resolution":{"observed_at":"2026-08-07T10:50:52.712377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:50:52.719441Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.719441Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:77018d0fae74e314c6f932806d75b37fee1bd85e486ee7d453b2edacf2312f6f","observation_id":"757897fa-3c40-4072-bca9-bb4530bc2848","resolution":{"observed_at":"2026-08-07T10:50:52.719441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:50:52.728028Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.728028Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4c3deb4cfcfc6cc367cfc922bdcec7442feb86618f671222550d8ef518d73471","observation_id":"a410c64e-8898-4152-9fd8-a7bd08e38da9","resolution":{"observed_at":"2026-08-07T10:50:52.728028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.105754Z","title":"video-SALMONN: Speech-enhanced audio-visual large language models","venue":null,"work_id":"b43c3a32-edee-4e09-a721-bea8a847f53e","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.734466Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:2efac2f8f9fca441599c6706020d040125c7d6373eb965951089d9b8e776ce4d","observation_id":"e8db80ae-0bf3-485d-b398-3fc0753f61e4","resolution":{"observed_at":"2026-08-07T10:50:55.110689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.088905Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"653a8265-568d-4ca8-a01b-3d73b1fee2fd","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.741622Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:791583cdf44f6e235da0eed7e11bcf1b7b9fb27cecea4dcfc156a50df5e14992","observation_id":"d2d7f427-c064-4870-b456-31241f56a0db","resolution":{"observed_at":"2026-08-07T10:50:55.094678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.069854Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning, 2023","venue":null,"work_id":"8451b47d-1c7e-4fb8-8e82-10dd9a217170","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.749258Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:767508c5867b0a959d5cacc6827665355dc5c39d961d1ddb24ffffe2f0fef60a","observation_id":"b7dc4d74-c4f0-4614-b6be-86224e0a7b4e","resolution":{"observed_at":"2026-08-07T10:50:55.076047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T10:50:52.756287Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.756287Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ef4240fb12178d9477d33392dc228ddb9a86c7ffd980d2bbceb7f1aa3d6f602a","observation_id":"20a70e97-adf7-4fe3-8876-f3fb30f6b31e","resolution":{"observed_at":"2026-08-07T10:50:52.756287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-07T10:50:52.761992Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.761992Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:dda5590722539b3d60bc13b7150f18bfb20af16cd900c7d157a661b29cbc4d49","observation_id":"c633c6df-ccb1-4ba4-9085-88e1fd92b35f","resolution":{"observed_at":"2026-08-07T10:50:52.761992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-13T00:32:27.032316Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T10:50:52.768322Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.768322Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:e69b01cd9d407882adf40459367db6c0daecdc62ec922c62d6096ba405917cbd","observation_id":"061cff8b-33b5-4e83-a9cd-f71616a5ae0e","resolution":{"observed_at":"2026-08-07T10:50:52.768322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.047814Z","title":"Robohop: Segment-based topological map representation for open-world visual navigation","venue":null,"work_id":"34c10e8e-8f12-44b2-aea5-65571e2d4a94","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.775435Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:29e7a43a698d99be1debc991e3f9e3c06dd41f9f0b9114f12bddfc5c416e0664","observation_id":"c14d7703-8bd6-4d2b-88ae-881a8999a0dd","resolution":{"observed_at":"2026-08-07T10:50:55.054845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.782291Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.782291Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0858a948131fb5b928b568da86a60d1aeedda98450a4cd0dc6c76c974873ce25","observation_id":"26c96cbc-7529-41bd-b782-88ab2c7aae1d","resolution":{"observed_at":"2026-08-07T10:50:52.782291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.012653Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning, 2024","venue":null,"work_id":"af9ad727-e0b0-4443-924f-40aac91b0401","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.789671Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:42b7ed1c3e818800e2cae34efec35aef47f29fba3da8afe0d44bfbb2a9ada899","observation_id":"5615034d-7b85-4e48-83af-89adf22e580d","resolution":{"observed_at":"2026-08-07T10:50:55.021240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-12T01:26:20.728055Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-07T10:50:52.796197Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.796197Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:9d62c16437a1a89c3fe8065a4ea2b0452db775cda5ad17582887949123e83dfd","observation_id":"cfa85fcf-2cdf-4e1d-8934-7ba0409f6ef4","resolution":{"observed_at":"2026-08-07T10:50:52.796197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-12T23:13:45.948951Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-07T10:50:52.802988Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding.arXiv preprint arXiv:2412.00493, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.802988Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:808260dde635a310604245dc2fc195fd0d2e20a4980bdd73d62beb3199f518ce","observation_id":"3eabc801-a4d0-4b7b-ae40-b2bc915861bf","resolution":{"observed_at":"2026-08-07T10:50:52.802988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.809764Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.809764Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:dc43fba8fa320cea1ebdafe81c056e680e2d8a21e44a24f33705d10b90a2beb6","observation_id":"279161f6-8053-4e84-a3bf-af5e8044a284","resolution":{"observed_at":"2026-08-07T10:50:52.809764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.978683Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"0d283501-1cfd-4a68-9fff-ea9a6bd11181","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.816719Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:d817dbb657d0bfe3b196fc90d01cc167334b758a6cd7cd35aae239a40fd1afdb","observation_id":"1f6e8217-2a87-4753-8dee-63be6fbd7fbc","resolution":{"observed_at":"2026-08-07T10:50:54.985179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00734","last_updated":"2024-12-01T08:59:30Z","snapshot_observed_at":"2026-08-15T01:54:03.480697Z","submitted_at":"2024-12-01T08:59:30Z","title":"ChatSplat: 3D Conversational Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00734","snapshot_observed_at":"2026-08-07T10:50:52.823519Z","title":"Chatsplat: 3d conversational gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.823519Z"},"links":{"cited_paper":"/paper/2412.00734","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:e8aa317d25bd2fcadcf608fd5c24871a345f12e6ea380202c39ae2fc166b6f6b","observation_id":"88f90bd5-fb71-45df-912b-dd854a51244c","resolution":{"observed_at":"2026-08-07T10:50:52.823519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.957199Z","title":"Language embedded 3d gaus- sians for open-vocabulary scene understanding","venue":null,"work_id":"4fc4d24f-1255-4f41-92b3-10896c8b0456","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.831954Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:6aece1512b57f99261963955a6517d182d8e9e6ab92fda9c67e77a572a366810","observation_id":"b1d1f0eb-5cd9-4f36-aa76-5afbb6c206db","resolution":{"observed_at":"2026-08-07T10:50:54.965124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:50:52.840774Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.840774Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:a5c1d85edce6bc9750ab486682adbd7a9a285c6a0684c0d8006343a3cc456836","observation_id":"c43b3d02-3cd2-42ba-af71-3d520818c96b","resolution":{"observed_at":"2026-08-07T10:50:52.840774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.940113Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","venue":null,"work_id":"f2bd592a-cf1c-4ecb-be29-41707281e676","year":2018},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.848124Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b7801408c71fe43024df9f85b1ea982cade19469145125d1c8eeb40a73179f3b","observation_id":"fff3a9a3-9b5c-44a7-98dd-53a5720c8082","resolution":{"observed_at":"2026-08-07T10:50:54.945823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.921664Z","title":"Robust sound source tracking using srp-phat and 3d convolutional neural networks.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:300–311, 2020","venue":null,"work_id":"ca68334f-942a-4471-9eb4-d15f5312bf31","year":2020},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.854282Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:5a7e2c25f9755cd9a4e228a88b8301e13582e2b9ca27d67e2ae940aadd87e21d","observation_id":"604093e5-88f7-44b7-8c2a-be60f54dca3f","resolution":{"observed_at":"2026-08-07T10:50:54.927560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01591","last_updated":"2025-05-17T22:03:39Z","snapshot_observed_at":"2026-08-13T04:28:11.471963Z","submitted_at":"2024-02-02T17:34:53Z","title":"BAT: Learning to Reason about Spatial Sounds with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01591","snapshot_observed_at":"2026-08-07T10:50:52.861092Z","title":"Bat: Learning to reason about spatial sounds with large language models.arXiv preprint arXiv:2402.01591, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.861092Z"},"links":{"cited_paper":"/paper/2402.01591","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:89a4c25cf5361e270fc275865e365642c9645a57022a32eaee86124cfa3bed70","observation_id":"efc636f5-7775-4511-97f9-5a2ddf7bfe92","resolution":{"observed_at":"2026-08-07T10:50:52.861092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T10:50:52.869518Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.869518Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:da0d83763b59477913f22bdb42201b0bb83294cd3dfb8de23b0a3c03d38dec9b","observation_id":"bb8ad452-b6a5-4306-b951-3c05b1870867","resolution":{"observed_at":"2026-08-07T10:50:52.869518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.902739Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"e3272df7-23b6-4e46-aa4f-b30629be56f5","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.877319Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ff891ecffc61fa061216ca7eeea2ab570b0a0c418d32f9f992a4a33f4fb1fa59","observation_id":"bc12e5ea-1e8b-4171-9691-9bf612a8fdfb","resolution":{"observed_at":"2026-08-07T10:50:54.909983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.882782Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.882782Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:5def73f08a878004a27781c434687140cf069967f410d5f825b439e5ac34082a","observation_id":"635378ff-4dab-49c3-9e8d-0bf0d600d337","resolution":{"observed_at":"2026-08-07T10:50:52.882782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-13T05:16:05.220753Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T10:50:52.887571Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models.arXiv preprint arXiv:2311.16103, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.887571Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:606452e071e9747ace4e6526ee345218d4dcf30d323ab11ab7cfc3b0291fe180","observation_id":"7015e766-957a-4caa-ae1a-f5ee80c334fc","resolution":{"observed_at":"2026-08-07T10:50:52.887571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.895136Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.895136Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:93362ada7d5377c2819fccc08bc6b6f89e3364145cc4a3e3c8702c2526388c68","observation_id":"b6c4f11c-2b5b-40bf-8e1d-df83df2d7f6e","resolution":{"observed_at":"2026-08-07T10:50:52.895136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:50:52.925613Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.925613Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:a3d48fd1f65c0b92fc18684fcbc3040ecd7c764e8a294f0fb51565844372b30a","observation_id":"1b58dd93-e748-4d80-b495-5a2a619c530e","resolution":{"observed_at":"2026-08-07T10:50:52.925613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.714408Z","title":"Egotaskqa: Understanding human tasks in egocentric videos.Advances in Neural Information Processing Systems, 35:3343–3360, 2022","venue":null,"work_id":"6f2bbe03-ad4c-4ef0-a9ef-1b3c62c66c5b","year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.049207Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:8556480e01d5c1f9edc7b0ce6f19e2a87d941cbf9532179ce78917c23314d21f","observation_id":"310fc69f-3eaf-45d3-aa84-59b71bcd55fb","resolution":{"observed_at":"2026-08-07T10:50:54.725195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.186552Z","title":"Vitatecs: A diagnostic dataset for temporal concept understanding of video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.186552Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ecf21418a33db8c6492ef8672b89f628ac2826921ae170dd514f74273fbcf4de","observation_id":"19258998-a866-4f9e-8f3f-d97f04b0a596","resolution":{"observed_at":"2026-08-07T10:50:53.186552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T10:50:53.344906Z","title":"Tempcompass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.344906Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:c3fd7d6406e24959200a7a26edc78000aa3d5bc5c13264cef3211fc457514759","observation_id":"9c23d341-727b-45fe-a305-5e5ebaa9831e","resolution":{"observed_at":"2026-08-07T10:50:53.344906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13646","last_updated":"2025-03-17T18:50:36Z","snapshot_observed_at":"2026-08-07T16:56:49.420728Z","submitted_at":"2025-03-17T18:50:36Z","title":"Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13646","snapshot_observed_at":"2026-08-07T10:50:53.504475Z","title":"Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos.arXiv preprint arXiv:2503.13646, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.504475Z"},"links":{"cited_paper":"/paper/2503.13646","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:84b2c82879d4b40229d455f276591537fce13eb9b7e987d9c5c426247c07e88f","observation_id":"de2fd68e-6b4e-4389-82a8-f67a378ad5e7","resolution":{"observed_at":"2026-08-07T10:50:53.504475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.564012Z","title":"Tackling data bias in music-avqa: Crafting a balanced dataset for unbiased question-answering","venue":null,"work_id":"756b99e9-b5eb-4b4c-90d2-9795125082d6","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.539032Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:7aa087586cb18a9bdb7a191f2dedcdd268c133ec95680a9a56d3ab8e799e98d2","observation_id":"5bb61c32-e1aa-46ba-831d-2129db380b73","resolution":{"observed_at":"2026-08-07T10:50:54.669457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.543428Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.543428Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:6119a37a7481b821151ddbe1b98e6f39fcbcc0046c71c98866f5088272227fc4","observation_id":"def4e580-b561-4b44-a3c7-3a91abb81f92","resolution":{"observed_at":"2026-08-07T10:50:53.543428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.392124Z","title":"Pano-avqa: Grounded audio-visual question answering on 360deg videos","venue":null,"work_id":"97c827c6-db0a-41f0-8ec0-18893d9a1af6","year":2021},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.548005Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:1ebd18877114e3801b9f58b6fb1da79c75fdc6e833300a6b5fdf4746f8e8ee2e","observation_id":"49b099fd-7b1b-4ebf-95bc-c124ef5a7b27","resolution":{"observed_at":"2026-08-07T10:50:54.416844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.369759Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"0933f3f7-553f-4e37-bb6e-cd3aa1a1bb08","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.553335Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:2596b633d6d4dafa35e3cf5e11f4374f50526008669b8330af5ffe8223b7458b","observation_id":"729992a3-cf9f-4247-93aa-6672fe9925b3","resolution":{"observed_at":"2026-08-07T10:50:54.377983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.558636Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.558636Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:c24f2cfde07804c9ba7987cbd09940fd7d968a9bfa34a49417380c1286776a84","observation_id":"aa926751-849e-4ffe-be82-aada78b03281","resolution":{"observed_at":"2026-08-07T10:50:53.558636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-13T04:14:14.123303Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-07T10:50:53.578305Z","title":"Aria everyday activities dataset.arXiv preprint arXiv:2402.13349, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.578305Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:47a146e7b2272e9ee5fbea52f12e0b5f122681d78d883ba58f7074f817b73f42","observation_id":"cdab30bd-6328-42ec-a59f-65cd428c537e","resolution":{"observed_at":"2026-08-07T10:50:53.578305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10224","last_updated":"2024-06-14T17:57:35Z","snapshot_observed_at":"2026-08-12T23:42:28.964240Z","submitted_at":"2024-06-14T17:57:35Z","title":"EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10224","snapshot_observed_at":"2026-08-07T10:50:53.582860Z","title":"Efm3d: A benchmark for measuring progress towards 3d egocentric foundation models.arXiv preprint arXiv:2406.10224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.582860Z"},"links":{"cited_paper":"/paper/2406.10224","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ccc763fada709ede61febd9bc127f7a50bca883d4e34851574fd7e7a2d299e45","observation_id":"535037db-2991-4d05-9af7-42db1e362124","resolution":{"observed_at":"2026-08-07T10:50:53.582860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.336364Z","title":"Photo-slam: Real-time simul- taneous localization and photorealistic mapping for monocular stereo and rgb-d cameras","venue":null,"work_id":"eaf0dd64-1222-40c6-8a07-bc2cac67d8f5","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.589037Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:1c3bd7f45a8af5d5687f65012223014f5337ec7f89576b9fc4d7f45838bccc32","observation_id":"807f7348-d4b2-45c7-ba36-a2e8112298f8","resolution":{"observed_at":"2026-08-07T10:50:54.344003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.314743Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"da084f06-00d5-419a-ad94-72a522fe1f12","year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.594292Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:3f5e14fcdccc1aaf171f7caebe20729361064386bd50cc834810756d1ce3c4ca","observation_id":"1fc0ec9a-3838-4591-b4fa-0b8096f1dfec","resolution":{"observed_at":"2026-08-07T10:50:54.322048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:50:53.598703Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.598703Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:cd25f01ffb1149c9838304361982d7fe10cfb98259890dc4dc01f0fd3e96154d","observation_id":"3bca59fb-6576-4c28-8f48-23d558462aba","resolution":{"observed_at":"2026-08-07T10:50:53.598703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-07T10:50:53.604010Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.604010Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:7ac5199f6c237bbc3e4ad3eb8a4b74bf2b067c189d295ec7c87a03688d9715a8","observation_id":"d4850f78-4ad4-4792-a478-502cc15fb36c","resolution":{"observed_at":"2026-08-07T10:50:53.604010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.294823Z","title":"Brown University, 2000","venue":null,"work_id":"6dd0bc80-a3c3-40fe-8904-bcf40e03c97e","year":2000},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.610157Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ef758b6a841809520252177bf76a004e607873119a5bd14de9ca284c8649092d","observation_id":"9f425254-a64c-4200-8c14-fc01a2b8f709","resolution":{"observed_at":"2026-08-07T10:50:54.300866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.275925Z","title":"Coherent-to-diffuse power ratio estimation for dere- verberation.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 23(6):1006– 1018, 2015","venue":null,"work_id":"b5b45e8f-1dd8-4108-bf8b-e87e407d3073","year":2015},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.616226Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:429ac462d68133762b91eeb7ade0000907af194e856337682ddcfde2967b518f","observation_id":"5eb5c881-4c66-4058-9e95-398f0fe18c18","resolution":{"observed_at":"2026-08-07T10:50:54.282138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.621308Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.621308Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:58e7091970f5000dcb8a5e5fd5c6f7a0c20583625a8b48db91a6be042e398ace","observation_id":"91ed6964-f625-4b2b-8f82-fc619039816a","resolution":{"observed_at":"2026-08-07T10:50:53.621308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.247833Z","title":"A new approach to linear filtering and prediction problems.Transactions of the ASME–Journal of Basic Engineering, 82(Series D):35–45, 1960","venue":null,"work_id":"b6d466ee-d2e6-4879-b52f-a865dbe52bae","year":1960},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.628005Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:83fb34a0f5c2d1935e1533801cb865b37d2b6aca6a84ab91635a70365235f205","observation_id":"02188b04-effb-453d-b0b7-83a0edf3fc75","resolution":{"observed_at":"2026-08-07T10:50:54.254676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.635225Z","title":"The pascal visual object classes (voc) challenge.International Journal of Computer Vision, 88:303–338, 06 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.635225Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:e473ebf083a90ca7c79c1a2f911b583aabc8ef421cb162fdc7895325ee2d1798","observation_id":"c8411998-4f37-4049-accb-4eef08f76a8e","resolution":{"observed_at":"2026-08-07T10:50:53.635225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:50:53.641537Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.641537Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:08bbcba75388ecbdfe0d8e1a71c52e76176523c89978aee34e28a417a989f45c","observation_id":"aa89350e-5ea6-4487-b41b-6fccf2ed5fd6","resolution":{"observed_at":"2026-08-07T10:50:53.641537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.217514Z","title":null,"venue":null,"work_id":"f4861f91-7a79-4491-8b2f-49d59fbe0357","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.648115Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ed54bfd5d8ccbfc7049771ef9c4f3ac89f8fec0d31261858ff24fc678ee3233d","observation_id":"5d13a14a-8e9a-4e43-adc4-bf1ea64118bd","resolution":{"observed_at":"2026-08-07T10:50:54.224692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T02:45:52.278549Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 3 inbound Pith citation observations for arXiv:2506.05414."}