{"as_of":"2026-08-13T16:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3de26983450dcddf2855f2db824d58c30eefe8ea345859acee5b0166db5261d8","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:01:33.912139Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:34:07.907336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T04:34:07.970750Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"cited_work":{"arxiv_id":"2412.11409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11409","snapshot_observed_at":"2026-08-11T04:34:07.970750Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","venue":"cs.CV","work_id":"ca9ed445-7bc9-4d3a-9ec6-556955fe8590","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-13T01:16:24.967163Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.907336Z"},"links":{"cited_paper":"/paper/2412.11409","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:b6b685c04b8209f128c8cff9e590d88fb37cdc3068d8b9917505674829dd2a34","observation_id":"6ece83f0-cdae-48d8-b707-a9faaa591b34","resolution":{"observed_at":"2026-08-11T04:34:07.977433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11409/citation-record","integrity":"/paper/2412.11409/integrity","json":"/paper/2412.11409/citation-record.json","paper":"/paper/2412.11409"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.739038Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.739038Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:e276ae89d73bbbec81bd22236d8f98324aa7e0f7daa5125a86ecf27cb655e2be","observation_id":"c705524e-f197-4a1d-939c-0c3fa5483dc6","resolution":{"observed_at":"2026-08-11T15:01:33.739038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.744102Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.744102Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:23ac7b24448e598f38951aef46cd3484fd0a58a3113948da2675f5937648c297","observation_id":"9e631196-c032-4965-bc13-04bbe0c34f52","resolution":{"observed_at":"2026-08-11T15:01:33.744102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.457034Z","title":null,"venue":null,"work_id":"56472399-9900-4b64-bdda-94090e3db10b","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.749585Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:f0717173559455ef3c3c27c3bd64309bfabb62f37c7dcc53579d88593b0a536f","observation_id":"5317d04d-bc0d-425d-83a1-b2e1a780c7e3","resolution":{"observed_at":"2026-08-11T15:01:34.462181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.441915Z","title":null,"venue":null,"work_id":"505c7c7b-276c-45a4-9114-0cf15adfbd37","year":2020},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.754047Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:b71b62af2192464cb9535751c01ab7d791745a9c8ec2aa599cf15cb7390f04d0","observation_id":"ffb4a67a-d664-4158-8575-be662b556a44","resolution":{"observed_at":"2026-08-11T15:01:34.446298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.427154Z","title":null,"venue":null,"work_id":"f6f27428-31ad-4a91-b301-af5386014c18","year":2023},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.759161Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:ff82a0f4d74e9699243f7c1343d637054b78fcf0deaceee9533f0fb0ffc62697","observation_id":"acb71e47-d6c8-4f24-bbca-d13450814309","resolution":{"observed_at":"2026-08-11T15:01:34.431945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.411282Z","title":null,"venue":null,"work_id":"38877e5a-e260-4c82-ae8a-0fcc3d42812c","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.763741Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:ab292e56b7e50509260da9e8c0d8d7cebd2b01bc02ed379f60789aa0c876729b","observation_id":"a79ebfa7-0d48-4c24-a165-d8486079fca1","resolution":{"observed_at":"2026-08-11T15:01:34.416672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.394868Z","title":null,"venue":null,"work_id":"bcc398a7-6bb1-48a8-8fb0-82bb5f975d56","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.767991Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:93af7567f1f18d7b65923acb73cdb22bf249613a00b72e635893a1cf699e2e6e","observation_id":"67654fb8-28d2-4741-824e-0d5c02c4aead","resolution":{"observed_at":"2026-08-11T15:01:34.399707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.379303Z","title":null,"venue":null,"work_id":"368690c4-ee12-4dbd-8cd4-8ac1e75cb538","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.772569Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:69ded8c4824981dd56e8017e940cd8a3d07adc62c0300c5660140295c1a52060","observation_id":"daace53f-7531-49e7-a731-8ac77f4de9ac","resolution":{"observed_at":"2026-08-11T15:01:34.384054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.776974Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.776974Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:6fc6553cce4f67c9532b9819ac0c733b4518a8e99c9c3379faf2832d366b24f8","observation_id":"6afcc842-ea5b-4c2d-8d9f-943ec20cf967","resolution":{"observed_at":"2026-08-11T15:01:33.776974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-11T15:01:33.780829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.780829Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:01d0e8bbcc3e7183b7eba9f76d40f0a012eadaf042efcc7c9ea7c726f73cbaa5","observation_id":"1b34d21b-ea50-411c-9aee-745b07d2dab8","resolution":{"observed_at":"2026-08-11T15:01:33.780829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.354083Z","title":null,"venue":null,"work_id":"29c2aeee-c78a-45db-b4b5-01ba4c3fc1c2","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.786306Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:8bfe402b6c1bed5d8cca36c7ea9cda29b6491c5eaf8a974525ca1010d3baa75c","observation_id":"e9b42dad-0124-4f16-8954-0d31983c5599","resolution":{"observed_at":"2026-08-11T15:01:34.358773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.791200Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.791200Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:4cc0e7b6a3f130ae35b7e2cc5566b157c6cc19625a45d88113870d134c4587a3","observation_id":"9ff317ad-9929-4402-a93f-f0be088005fe","resolution":{"observed_at":"2026-08-11T15:01:33.791200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14101","last_updated":"2024-12-23T08:57:37Z","snapshot_observed_at":"2026-08-12T22:20:27.972073Z","submitted_at":"2024-10-18T00:46:18Z","title":"Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14101","snapshot_observed_at":"2026-08-11T15:01:33.795919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.795919Z"},"links":{"cited_paper":"/paper/2410.14101","citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:bc81d9e06918f90db87fe7b6ed54d21fcb8a8229b4b539d9be68d57afbacb2dd","observation_id":"5ff458eb-6d03-4358-9d4f-977c5d726824","resolution":{"observed_at":"2026-08-11T15:01:33.795919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.329683Z","title":null,"venue":null,"work_id":"7ed947c9-f798-4c7b-8062-9e92e54583d2","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.800794Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:dde2948979521fd9ac3f73edcec342f568ed5016fc32445ba686fa16537f88c0","observation_id":"3947395a-d4de-42a0-bf82-50dbe3d93928","resolution":{"observed_at":"2026-08-11T15:01:34.334532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.315684Z","title":null,"venue":null,"work_id":"bb90a12d-198c-45ba-91f8-b9cd6b95f226","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.805342Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:50757930fcc4fd0219f080203270499a2f5b6502d254187036ea1522311c23c1","observation_id":"2001f691-e00a-460b-b8fe-fb14d7720ec7","resolution":{"observed_at":"2026-08-11T15:01:34.320257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.302247Z","title":"I Want to Figure Things Out","venue":null,"work_id":"66a0b70a-0421-45ee-9c0d-ea07c96f4e89","year":2023},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.810025Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:bfbd99ac5afd66626261357aab397c81d01bf9d87824fc1caf9cd00b3506a980","observation_id":"1be592c6-f85d-4895-89d2-5d38ccae6684","resolution":{"observed_at":"2026-08-11T15:01:34.306395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.288445Z","title":null,"venue":null,"work_id":"71199d26-ce3f-4a61-bfeb-c00dff320daf","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.814503Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:23f4b9923246bc4e70bf1299f1ce4360598a7e1afa4e1c54b5cf189d4c0d4720","observation_id":"9574b814-ab1e-4dec-b20f-7b5d18629c11","resolution":{"observed_at":"2026-08-11T15:01:34.292349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.275361Z","title":null,"venue":null,"work_id":"fb60e1b9-bb2b-4b9c-948f-00786a7e8c9a","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.819181Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:2d6f642a2a60c93017ee87b29d9a182fd8e91fb459ff0bd113ab6df2895a711a","observation_id":"dd355004-bb8f-4cbb-8192-a963e173c590","resolution":{"observed_at":"2026-08-11T15:01:34.279446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-13T15:27:09.693765Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-11T15:01:33.823743Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.823743Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:b2a7eaca41ce7a62e8677041cfaf622863404f14ead581ab7a74a2ca8be52cc8","observation_id":"40ae4745-caec-445a-a88f-6ae1dd587d2c","resolution":{"observed_at":"2026-08-11T15:01:33.823743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.262051Z","title":null,"venue":null,"work_id":"f9e0575b-4354-4ca1-b382-9142a0259c84","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.829016Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:458493458a976ff79a2cf15b9644ad12db3d8e773bbe439c65898aea982ccef8","observation_id":"c0978bca-366d-49ac-801b-55b80b065418","resolution":{"observed_at":"2026-08-11T15:01:34.266073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.247535Z","title":null,"venue":null,"work_id":"f43fd1f9-43ca-4ce7-81f3-6ec962772cf7","year":2023},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.833955Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:de9ede53f1e5577a77eda3b7da699b39d3f09feefdc182daa0aedffb199d9b17","observation_id":"70e70d2c-3577-409f-8edb-c6d83fec4a91","resolution":{"observed_at":"2026-08-11T15:01:34.252060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.232500Z","title":null,"venue":null,"work_id":"dc078353-c7b6-4783-9ae7-4018233d0502","year":2023},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.838309Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:4526b18df4d3079054e42575fc6bc18b511c9a99f967d2890d5518f08ea2946a","observation_id":"69526ea0-acd6-4c1a-b90b-a65febcd5a91","resolution":{"observed_at":"2026-08-11T15:01:34.237380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.216960Z","title":null,"venue":null,"work_id":"5b06e9c1-0a8a-4678-a628-9063f93bfb04","year":2023},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.842440Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:3e15827bd72265c04bf0a93927c2caa2a89359e81a47910ff804587d747c12bd","observation_id":"7a359cd9-a89b-4151-b592-2b6075e3e73b","resolution":{"observed_at":"2026-08-11T15:01:34.221868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.201826Z","title":null,"venue":null,"work_id":"38df162f-2f58-4295-a9be-06ec408c2469","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.846787Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:c45692fa321ee6d3aa46955da42654197f88045ce7cb9391def4f6dbfbecfcc2","observation_id":"95b7c3d1-10b7-4e3d-9774-a5ee7c04d747","resolution":{"observed_at":"2026-08-11T15:01:34.206779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.186512Z","title":null,"venue":null,"work_id":"069bae24-4bba-462b-9fd9-7ccb5145e2f6","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.851111Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:45b52e6861cb6bcdd78d72402801da81027937dab61835ff5e50788d9b1ebc23","observation_id":"55ec6a08-cbb9-4afb-bae2-853d5c06997c","resolution":{"observed_at":"2026-08-11T15:01:34.191700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.171818Z","title":null,"venue":null,"work_id":"dccfb42f-a49f-4f6c-9ece-e996150236e0","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.855330Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:f322eb809058310e11f0933e8aab1a7fa5574afbaa610b897ae0b10249aa1fe8","observation_id":"0b52ec4d-6e79-4e64-b88e-82f8156726f0","resolution":{"observed_at":"2026-08-11T15:01:34.176506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.157353Z","title":null,"venue":null,"work_id":"ccb6b0c2-4e88-48f6-8f39-d85133a81704","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.859348Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:8631daced98ed668b780fe8e2cc8240b501f99ead7e2673d535eef754d3e9fe0","observation_id":"4ed2f487-db09-40f8-856e-fd0699c39ed2","resolution":{"observed_at":"2026-08-11T15:01:34.162005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:33.864813Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.864813Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:324606fe1de9de3ed94c4dce667853ae1b1b2b9e9747b2762ad3d3508e5ed392","observation_id":"b48ec891-ff5a-4114-a4ff-f89f1b5c907f","resolution":{"observed_at":"2026-08-11T15:01:33.864813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.133972Z","title":null,"venue":null,"work_id":"d7fbeb60-4e7d-4887-b1b7-64ab4053ba77","year":2021},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.868936Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:aee8f2841473c378d4932725fc4eee6167121c8a7d85145a44a375a619fb1c3c","observation_id":"1e94e569-b79c-4f41-b772-23178a59a521","resolution":{"observed_at":"2026-08-11T15:01:34.138379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.121302Z","title":null,"venue":null,"work_id":"8c13602b-bf55-41ff-a65b-746f4d5c93a7","year":2019},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.872844Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:fdddd5cf636babe9c941676e372dc8a315d6fa74de19fc94a6c92ccbddf4822c","observation_id":"640690fe-27a4-4af8-98ac-b369067a71bd","resolution":{"observed_at":"2026-08-11T15:01:34.125191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.107309Z","title":null,"venue":null,"work_id":"6ff8516a-1a0c-4a61-8962-83a8492c78ab","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.878274Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:86ca8e6d8094de970f1edd0501cc6476166a49fb1a7ce32727f11699afd1e36e","observation_id":"79c5ca32-baf5-4c51-a7dd-bb5b881743ab","resolution":{"observed_at":"2026-08-11T15:01:34.112109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.092203Z","title":"N.; Tran, S.; Yao, B.; Chilimbi, T.; and Shah, M","venue":null,"work_id":"b5e56b0a-9b2e-4459-8a87-99b754c78004","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.882704Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:1506b2fa410e3995130613e9117e5bf2b2e6a9057683238dd4a8629a2663080f","observation_id":"0c14f8f4-2d1c-4f34-80e8-7f37a6a47d4e","resolution":{"observed_at":"2026-08-11T15:01:34.097133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.076663Z","title":null,"venue":null,"work_id":"03a16bd1-19b0-4451-b47a-683069cdff10","year":2022},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.887301Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:47f11279efb2c349c783b8ddc48c0057be07019a04881bcc78d950d75bb1bfbd","observation_id":"38206b27-7f94-472a-9891-5a092783cb75","resolution":{"observed_at":"2026-08-11T15:01:34.081238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T15:01:33.891600Z","title":"I.; Burnell, R.; Bai, L.; Gulati, A.; Tanzer, G.; Vincent, D.; Pan, Z.; Wang, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.891600Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:d182be0ca5e2993b022063ee0bb564836a1b27274fe0859c8f64f3880d88ad1b","observation_id":"1b240567-7cb5-4136-b312-0db0ea272faa","resolution":{"observed_at":"2026-08-11T15:01:33.891600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.062114Z","title":null,"venue":null,"work_id":"79b15b88-7ca6-4834-872d-780b782b3e85","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.897141Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:55c87911bcf4aff11e5c15dc12b628b707a6972ede6d11db6f4b873ff922f6c4","observation_id":"17aeb1c9-3e11-4734-853c-aad21ad18bd7","resolution":{"observed_at":"2026-08-11T15:01:34.066593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.047028Z","title":null,"venue":null,"work_id":"7c686ae3-7ba7-446f-890a-45ba4b58fef4","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.902340Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:01c6b51c1be1834520bf6a5decafc955b3817b7333d7a296e8f7a42f1081ee38","observation_id":"761eacb8-d295-4c79-bb62-0f9c58bee78e","resolution":{"observed_at":"2026-08-11T15:01:34.052267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.032606Z","title":"C.; and YAN, S","venue":null,"work_id":"d289005c-569d-4ffe-a390-c9e5da0513fb","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.907180Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:706d94bee0d8058a187be35c1bdd06a648b134400e4214aeb7a8202b2d6fd167","observation_id":"bd7e2edf-23ba-465b-9cbc-7bd953f8cfcb","resolution":{"observed_at":"2026-08-11T15:01:34.036847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:01:34.013729Z","title":null,"venue":null,"work_id":"7548d548-b9d3-437f-9c0e-8a751bce93a0","year":2024},"citing_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:01:33.912139Z"},"links":{"citing_paper":"/paper/2412.11409"},"observation_digest":"sha256:e88db964aaaa63b66b2176f48d7c58ed41d37d9a31b9ae072160e21475eae5e5","observation_id":"01a873bd-32f7-49ba-9806-04828d57aec4","resolution":{"observed_at":"2026-08-11T15:01:34.020850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T03:17:17.017036Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2412.11409."}