{"as_of":"2026-08-07T17:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a63e636266007407170411c6da730c3c0a32c76aa03364687985dd9460ffe7e","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:26:10.731298Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T20:46:04.875912Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T20:48:32.619134Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"cited_work":{"arxiv_id":"2507.02813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Langscene-x: Re- construct generalizable 3d language-embedded scenes with trimap video diffusion.arXiv preprint arXiv:2507.02813","venue":null,"work_id":"288187ad-0868-4cd0-bea1-cde7c2fb7c75","year":2025},"citing_paper":{"arxiv_id":"2512.17541","last_updated":"2026-04-05T17:51:43Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T13:04:13Z","title":"FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T20:46:04.875912Z"},"links":{"cited_paper":"/paper/2507.02813","citing_paper":"/paper/2512.17541"},"observation_digest":"sha256:df25af4d0f55664787cc8fbbb4ec9247007f37e919dd4237649112c162136c11","observation_id":"33d0b0fb-25af-4e02-9cc8-a9db8557c60f","resolution":{"observed_at":"2026-05-16T20:48:32.622421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"cited_work":{"arxiv_id":"2507.02813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Langscene-x: Re- construct generalizable 3d language-embedded scenes with trimap video diffusion.arXiv preprint arXiv:2507.02813","venue":null,"work_id":"288187ad-0868-4cd0-bea1-cde7c2fb7c75","year":2025},"citing_paper":{"arxiv_id":"2604.14706","last_updated":"2026-04-16T07:14:07Z","snapshot_observed_at":"2026-07-06T23:02:27.141640Z","submitted_at":"2026-04-16T07:14:07Z","title":"NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T11:53:22.566217Z"},"links":{"cited_paper":"/paper/2507.02813","citing_paper":"/paper/2604.14706"},"observation_digest":"sha256:39213a6916bd9042bca78ac332a06580ebed37572ea615c54f7d92040b1921e3","observation_id":"1ddcfd7f-f597-4e2a-a764-225ff3c1203d","resolution":{"observed_at":"2026-05-10T11:55:20.610305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"cited_work":{"arxiv_id":"2507.02813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Langscene-x: Re- construct generalizable 3d language-embedded scenes with trimap video diffusion.arXiv preprint arXiv:2507.02813","venue":null,"work_id":"288187ad-0868-4cd0-bea1-cde7c2fb7c75","year":2025},"citing_paper":{"arxiv_id":"2604.21914","last_updated":"2026-04-23T17:57:13Z","snapshot_observed_at":"2026-07-31T18:25:32.532748Z","submitted_at":"2026-04-23T17:57:13Z","title":"VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T21:18:12.192842Z"},"links":{"cited_paper":"/paper/2507.02813","citing_paper":"/paper/2604.21914"},"observation_digest":"sha256:4ace7b06fba30d4cc06bda17609f2e39ea401389e09fb5cb2f7a17a6722b9248","observation_id":"92ad6003-1e25-4413-bd8e-e4fdfd66ca4c","resolution":{"observed_at":"2026-05-11T14:41:13.785497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02813/citation-record","integrity":"/paper/2507.02813/integrity","json":"/paper/2507.02813/citation-record.json","paper":"/paper/2507.02813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.00390","last_updated":"2022-09-07T04:14:48Z","snapshot_observed_at":"2026-08-07T15:26:15.477145Z","submitted_at":"2021-12-01T10:17:25Z","title":"SegDiff: Image Segmentation with Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00390","snapshot_observed_at":"2026-08-06T20:26:10.485250Z","title":"Segdiff: Image segmentation with diffusion proba- bilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.485250Z"},"links":{"cited_paper":"/paper/2112.00390","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:d43ce8eb063a746588df46b384e8f1b2c22b25a285af8d749a185b154cc1d823","observation_id":"2ba00fcf-dc2a-4cd3-8009-2215fac3b0ab","resolution":{"observed_at":"2026-08-06T20:26:10.485250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.571435Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"10b003c0-a15d-4524-9448-14a74e766230","year":2022},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.490698Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:140461affcec6c469f61c29b3c26eda858d3678529524de87aa4c1aa7717f227","observation_id":"8c24e836-1846-4fb5-84ca-e273ff01f671","resolution":{"observed_at":"2026-08-06T20:26:11.575492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-06T09:54:26.134418Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-08-06T20:26:10.495325Z","title":"Vd3d: Taming large video diffu- sion transformers for 3d camera control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.495325Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:2b295e96f64a2d620a866b77026efe5a71b91ed33025911bcd2376a77604328b","observation_id":"ab5176a5-be07-4a85-a416-cb99f9d3e077","resolution":{"observed_at":"2026-08-06T20:26:10.495325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.501075Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.501075Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:20a2ef2b0903f8d12f763c5629f9c007944696174ff94c37a83b204cb35b0b6c","observation_id":"702b9339-e220-486b-9577-73612a2e86c9","resolution":{"observed_at":"2026-08-06T20:26:10.501075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06521","last_updated":"2025-01-10T12:05:16Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-10T17:59:01Z","title":"PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06521","snapshot_observed_at":"2026-08-06T20:26:10.505304Z","title":"Pgsr: Planar-based gaussian splatting for efficient and high-fidelity surface reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.505304Z"},"links":{"cited_paper":"/paper/2406.06521","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:124ae29809188776e878f89f1bc2c42739b390c91da7b48086580fa322db404c","observation_id":"560d5a49-c128-455e-b2d4-bb520d2f5bf8","resolution":{"observed_at":"2026-08-06T20:26:10.505304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.548625Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":"20b9791f-07c8-4f15-b021-b7efb7bfd4fb","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.510017Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:1118040f2b51de99aecb00f13c0fa2135d8ba5e64c731d7e6435c814228d1871","observation_id":"a1093ef5-d166-45b6-ab6d-b7bd09acf525","resolution":{"observed_at":"2026-08-06T20:26:11.552600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.535934Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"55a436f2-51d1-4e9e-89dc-211e25ea248a","year":2017},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.514928Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:94e6cf53bd50c2788c4f706aca6e840bb9aad47e978cf8d83ed42b4fb39ed578","observation_id":"00bee198-6472-4cdc-8804-20acb66a67ec","resolution":{"observed_at":"2026-08-06T20:26:11.539853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.523469Z","title":"Large spatial model: End-to-end unposed images to semantic 3d","venue":null,"work_id":"6f8427b6-d561-4c57-afdf-84051b7a8179","year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.519495Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:7b39070df292d975528238ad9c32f4046e2539de6f5cf4ed5dc3dbb813e225dd","observation_id":"a671133e-0400-477a-9b4d-37640493ebab","resolution":{"observed_at":"2026-08-06T20:26:11.527302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.510659Z","title":"Random sample consensus: a paradigm for model fitting with applications to image analy- sis and automated cartography","venue":null,"work_id":"85328f00-53e4-4d82-aa2c-3599e70a73fd","year":1981},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.523577Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:8edd0914f7f999407f856d1c5514d7baeca25a535aee3028576b342901eb5007","observation_id":"4edcbdc5-3c37-4e1b-9211-3ea833820311","resolution":{"observed_at":"2026-08-06T20:26:11.514724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.498313Z","title":"Iqa: Visual question answering in interactive environments","venue":null,"work_id":"1aaa759c-c912-47fd-a5df-d550793b277a","year":2018},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.527780Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:b36b9e67955fb0bc0195774936c08f1c2aed0dad3d22ef303cab6b33e6311bc1","observation_id":"99e68be3-4479-4fa2-b0f3-8cf68ea5c5c5","resolution":{"observed_at":"2026-08-06T20:26:11.502255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.532027Z","title":"Sugar: Surface- aligned gaussian splatting for efficient 3d mesh reconstruc- tion and high-quality mesh rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.532027Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:1522c7926525772fdbc0911ed746960326385529b0e62f66bc5f3a812402d0c1","observation_id":"d5701d34-484b-4d2e-bc23-6139032ad08f","resolution":{"observed_at":"2026-08-06T20:26:10.532027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-06T20:26:10.536003Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.536003Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:53fd2915d103467a6b8d4bb3348dfe361ec018a90a6b434b435e68c49c82a403","observation_id":"6c7397a1-a266-480a-a4cf-7f81a2c3d63b","resolution":{"observed_at":"2026-08-06T20:26:10.536003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02245","last_updated":"2026-07-12T18:22:17Z","snapshot_observed_at":"2026-07-16T23:18:30.272482Z","submitted_at":"2024-12-03T08:18:56Z","title":"SparseLGS: Sparse View Language Embedded Gaussian Splatting","version":3},"cited_work":{"arxiv_id":"2412.02245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02245","snapshot_observed_at":"2026-08-06T20:26:11.114185Z","title":"SparseLGS: Sparse View Language Embedded Gaussian Splatting","venue":"cs.CV","work_id":"aec1cca8-0c9f-49b9-9da5-af8e1a582491","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.540584Z"},"links":{"cited_paper":"/paper/2412.02245","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:829bbacee1f6e903e357317001ddf0f8012fa2349aec6cbd956c7944057639c5","observation_id":"ad221c26-2cd7-4a69-af52-afbb14e32f37","resolution":{"observed_at":"2026-08-06T20:26:11.119535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-03T20:30:51.594078Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-06T20:26:10.545095Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.545095Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:a4cf65b48f4e77998b034e8151897182fb1f2470c0ffe8c953020037a973e8e3","observation_id":"d6dcd6a3-1953-4a52-870d-1c6e7b2fb79a","resolution":{"observed_at":"2026-08-06T20:26:10.545095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.476491Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"cbd36e9e-dd95-4298-8dbb-9deedbf235bb","year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.549768Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:30151d2ca6f16f0f321c04459344d93e151a7a9a06d1992ffebfb0a2cfa303ff","observation_id":"650467ba-9673-4bbf-9730-1b30551f9038","resolution":{"observed_at":"2026-08-06T20:26:11.480640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.558642Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.558642Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:a8a596684d60528e2512dbe7461229bd76ef8fe6f9bd25f056be334ba8d91441","observation_id":"95fe322b-823b-4bb5-b9c7-e4940a7ca05d","resolution":{"observed_at":"2026-08-06T20:26:10.558642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T20:26:10.562955Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.562955Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:5c267734c0875d71a3cfd02f31f3f3f97aab053163870f4c199d495d93fbf9f5","observation_id":"33c246f3-1211-4ce6-9869-f0a9a28e170f","resolution":{"observed_at":"2026-08-06T20:26:10.562955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.450313Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"90de2f77-3a86-4a24-888b-b9ad25b550f1","year":2022},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.567968Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:5ac6360be3a2a79d6ff8dece2c023a7897806b29f3509ded956c29e85e947d64","observation_id":"aefb78a9-159c-4af5-89af-c8c4943bbe05","resolution":{"observed_at":"2026-08-06T20:26:11.458186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.572250Z","title":"Langsurf: Language-embedded surface gaussians for 3d scene under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.572250Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:d9bb728e4dc7e01d15c1673273872a189dc029749acce70cb8eb298ed3912dc6","observation_id":"bdc9fe5c-b17d-4264-98e1-3db0c15f292f","resolution":{"observed_at":"2026-08-06T20:26:10.572250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.576980Z","title":"Gp- nerf: Generalized perception nerf for context-aware 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.576980Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:ec762c0c02b45406cfa5f487e855ff456562f020b92eb3b385e95c83abc5c8da","observation_id":"4657ebb9-27b7-49b0-8764-a76531c8dce3","resolution":{"observed_at":"2026-08-06T20:26:10.576980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.581135Z","title":"Dngaussian: Optimizing sparse-view 3d gaussian radiance fields with global-local depth normaliza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.581135Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:6755cf54ee39e09b79bc361657653e73debd7df7162f5bc5a8a9d115ba94fac9","observation_id":"ffe2ab00-0a5b-4b7d-89c1-9c7a8328c928","resolution":{"observed_at":"2026-08-06T20:26:10.581135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.408618Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"3798dbf9-3878-4067-be99-6f825ab3e40c","year":2014},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.585876Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:d6df4ee4b0fee9c7520d0ac1dd2757190ff6c831afbe4d11a83e11df9a6f9088","observation_id":"879e0617-5f42-41ab-a3df-1c48a85518ca","resolution":{"observed_at":"2026-08-06T20:26:11.419116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.386339Z","title":"Infinite na- ture: Perpetual view generation of natural scenes from a sin- gle image","venue":null,"work_id":"9fdb18ef-8bea-4dc4-8e73-a28d7814b36b","year":2021},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.590058Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:cc257aa2e79f502f8a30af80d9119f17718e73181e0d7dac5c069730b4bc2e8a","observation_id":"3aa9618f-d615-4f13-9ec7-1f27fad952a8","resolution":{"observed_at":"2026-08-06T20:26:11.392621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.372100Z","title":"Semantic ray: Learning a generalizable semantic field with cross-reprojection attention","venue":null,"work_id":"3552c678-1028-4da3-af70-4600f48ee320","year":2023},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.594803Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:160763961cba8e6b3cdfac9778ecd40970fcb213d2ced551a0b48e7a16476f52","observation_id":"9a7b4c84-e442-446c-937a-e10205ac8651","resolution":{"observed_at":"2026-08-06T20:26:11.377059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-01T22:53:31.767507Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-08-06T20:26:10.599197Z","title":"Re- conx: Reconstruct any scene from sparse views with video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.599197Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:59886965beeb69b9c8a753756885e5fa00995259f63c390ddf2d62bf1a67fc1f","observation_id":"f5734084-3444-42ef-a038-169e0f07a17a","resolution":{"observed_at":"2026-08-06T20:26:10.599197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.358134Z","title":"Make-your-3d: Fast and consistent subject- driven 3d content generation","venue":null,"work_id":"65bce2e6-b877-4df9-abf0-64e206121789","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.603721Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:8ee6a50c040705426eee5a271b359e7a8c2930f5e0e5df494528eadb44502796","observation_id":"202a909a-fdc0-40ba-a51c-9957341dc664","resolution":{"observed_at":"2026-08-06T20:26:11.362417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04338","last_updated":"2024-06-11T03:36:09Z","snapshot_observed_at":"2026-08-05T06:55:16.693643Z","submitted_at":"2024-06-06T17:59:47Z","title":"Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04338","snapshot_observed_at":"2026-08-06T20:26:10.607650Z","title":"Physics3d: Learning physical properties of 3d gaussians via video diffusion.arXiv preprint arXiv:2406.04338, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.607650Z"},"links":{"cited_paper":"/paper/2406.04338","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:5c37c9728a4c103dbbe3b8b57e205c839be02e17f98a711d98c9e310acfa693d","observation_id":"ae15fd43-e018-46a2-841f-f31d3c2af895","resolution":{"observed_at":"2026-08-06T20:26:10.607650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T20:26:10.612591Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.612591Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:a691bd32cdb287cf0de1a028c000d39a6bb11c34360af97961b98efc92a23f32","observation_id":"20d2d07c-0fc2-477e-a6d9-8d80c82c699b","resolution":{"observed_at":"2026-08-06T20:26:10.612591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.617454Z","title":"Gaussian splatting slam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.617454Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:266e80b963a5827b38fe284072855bd0443494d344e61e8600edd6ab98c4b0d1","observation_id":"9a74b982-b103-410b-b1e7-7b8783a0203b","resolution":{"observed_at":"2026-08-06T20:26:10.617454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.621535Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.621535Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:aca6906f65c7e23c01d793925126cd5514c360dd521637c4cf612618706932f1","observation_id":"6bbe1d33-99a9-4dfc-93e5-f9499cd9f715","resolution":{"observed_at":"2026-08-06T20:26:10.621535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.327431Z","title":"Sift: Predicting amino acid changes that affect protein function","venue":null,"work_id":"cceb93ee-4248-490e-b86e-882cd6c09666","year":2003},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.625528Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:e8cfd8a30d9c21feae08a6e8821692af8bed87838c64cc6f161fd99192379b4f","observation_id":"7f6d95e9-1898-482a-9dee-928897084797","resolution":{"observed_at":"2026-08-06T20:26:11.331927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.629501Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.629501Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:f88fff0da18974c45479c6c5b1a093ac318af068a6aa089414c15505bbc328ea","observation_id":"78a107e8-d47d-47ee-a835-ae292b11209d","resolution":{"observed_at":"2026-08-06T20:26:10.629501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.304981Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":"8a8f1a0f-467f-4104-bde0-286d6af09fbb","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.634390Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:518f48ea55aa75dd53e9a4dad5ea28cd6728042b73913a9ff1bdcb1671b8c2b5","observation_id":"3d0c6447-2761-402d-8cf9-50107ee7c3bd","resolution":{"observed_at":"2026-08-06T20:26:11.309471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.291226Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"81632802-23c9-44aa-a041-2f529c7a5de6","year":2021},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.638836Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:8071fd82ea7261f849315d3107bb62bf0009ebdb539713c64291883c2a162e7f","observation_id":"8d0f8964-70a6-430c-b7bc-df4414790a17","resolution":{"observed_at":"2026-08-06T20:26:11.295710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.277456Z","title":"Language embedded radiance fields for zero-shot task-oriented grasping","venue":null,"work_id":"0e4bf5c8-70f6-4a96-8d69-e2a2ebf45d6e","year":2023},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.643064Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:fa73262333a9e685fb34f4b26478288d198b40c7bc770b5a169bee2aa6a53844","observation_id":"0c0b20d5-7a6e-4237-861a-da58180303a0","resolution":{"observed_at":"2026-08-06T20:26:11.281973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T20:26:10.647263Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.647263Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:c5ed06cc8b36af17a47cf0e8a8bb84cc9f6edf0fff37fa939e6f522af9814453","observation_id":"16d2046e-4f69-404c-a0a1-268129f03364","resolution":{"observed_at":"2026-08-06T20:26:10.647263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08034","last_updated":"2024-11-17T03:45:07Z","snapshot_observed_at":"2026-08-04T18:42:03.338895Z","submitted_at":"2024-11-12T18:59:35Z","title":"Scaling Properties of Diffusion Models for Perceptual Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08034","snapshot_observed_at":"2026-08-06T20:26:10.651525Z","title":"Scaling properties of diffusion models for perceptual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.651525Z"},"links":{"cited_paper":"/paper/2411.08034","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:eaaefcd1d5a7df7c2a3b1e47704389972a3862dad638f32cbf6a9a5a5ac98d61","observation_id":"4cfc5efb-48f3-449b-8c94-83085e319eb2","resolution":{"observed_at":"2026-08-06T20:26:10.651525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13290","last_updated":"2023-06-23T04:56:47Z","snapshot_observed_at":"2026-07-06T15:45:47.517122Z","submitted_at":"2023-06-23T04:56:47Z","title":"Robustness of Segment Anything Model (SAM) for Autonomous Driving in Adverse Weather Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13290","snapshot_observed_at":"2026-08-06T20:26:10.655782Z","title":"Robustness of segment anything model (sam) for autonomous driving in adverse weather conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.655782Z"},"links":{"cited_paper":"/paper/2306.13290","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:fa09dfc0e3ac7efa3a6de304be8f39d08d8d91fb3338e1e41af6a604a9b02568","observation_id":"4015ad1e-4e98-430a-806e-28a7774615e2","resolution":{"observed_at":"2026-08-06T20:26:10.655782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-03T17:25:16.750670Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-06T20:26:10.660772Z","title":"Learning temporally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.660772Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:2ee47aaeb1b43de4ee20189758c872c574da329e59eb6a8f4f85f2dd532c91b2","observation_id":"f796409e-3e49-47f6-be21-de314265e29b","resolution":{"observed_at":"2026-08-06T20:26:10.660772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-06T07:44:13.960536Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-06T20:26:10.665816Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with controllable video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.665816Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:495af9430154cbd6db591c27080a84845945c657477be45c6653d54758760731","observation_id":"2391828b-e872-4545-a342-40bad334e217","resolution":{"observed_at":"2026-08-06T20:26:10.665816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.263241Z","title":"Neural discrete representation learning","venue":null,"work_id":"8aa85dac-bf89-43b7-845c-65632807af6e","year":2017},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.670213Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:c950886b31471fcba9529c5e5bbc0841e4f7de4dd55550520376f65e9e4bddd6","observation_id":"506ce214-9099-474b-a186-76021252fe87","resolution":{"observed_at":"2026-08-06T20:26:11.267870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.675125Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.675125Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:cb3fabe33a66765fa72d9284c2f4e8f6f2d45c30f3dc722c272845a57aa81596","observation_id":"edc2e6db-53b6-4c67-b1ca-9cefc1ca3aff","resolution":{"observed_at":"2026-08-06T20:26:10.675125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.241474Z","title":"Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":"c5941abf-9e60-4e57-beaa-bc5e76823ca3","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.679594Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:d9b8eb76b51e59ea43ff50333eddbebc94e44d5bccf0af803d0e204514044a90","observation_id":"5e2f1175-642d-41fd-b604-eddf3f3fd8b7","resolution":{"observed_at":"2026-08-06T20:26:11.245962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.683800Z","title":"Dust3r: Geometric 3d vi- sion made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.683800Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:f9949fb51ae0de93a9c6502cc9773cba347fb0be2c012a9d1f49b6300356fd27","observation_id":"ea0e8247-a121-4b00-9931-562c30aca80b","resolution":{"observed_at":"2026-08-06T20:26:10.683800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02058","last_updated":"2024-12-06T14:49:23Z","snapshot_observed_at":"2026-07-06T18:25:01.240019Z","submitted_at":"2024-06-04T07:42:33Z","title":"OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02058","snapshot_observed_at":"2026-08-06T20:26:10.687969Z","title":"Opengaussian: Towards point-level 3d gaussian-based open vocabulary understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.687969Z"},"links":{"cited_paper":"/paper/2406.02058","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:08bd6d132b3e5e75712aa62ac5967ffcae67cb21b2709720dac4ab88795c854c","observation_id":"335c0d32-a83a-4248-b557-f0cc46b319fa","resolution":{"observed_at":"2026-08-06T20:26:10.687969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.692552Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.692552Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:ac86cb57f8e0990b59b383d3e92df78adb6982afc67395d0c92247a918dc6a1e","observation_id":"6988754d-8987-4e89-955e-4b2325ccbca4","resolution":{"observed_at":"2026-08-06T20:26:10.692552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T20:26:10.697300Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.697300Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:09014bf1c17343a80281c07910288c0422a1a1c85eb2634e5c91a9428a59a409","observation_id":"3661aea2-e974-441a-aff4-5e9992b1aff9","resolution":{"observed_at":"2026-08-06T20:26:10.697300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:26:10.702612Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.702612Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:b7bf23a5bf40e22bf4435948bc8d75421220b3d3d12cebb1e0c0bddcb4356655","observation_id":"cfda3e98-8668-4489-a746-fe1a5e560a8a","resolution":{"observed_at":"2026-08-06T20:26:10.702612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.209241Z","title":"Stablenormal: Reducing diffusion variance for stable and sharp normal","venue":null,"work_id":"ec8db785-bc12-4df6-a6f9-2147d8710e54","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.707596Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:6166b3a981ef2df19672b87db0dc149c82d79d2a1d87ad6e924303ac15a070b2","observation_id":"36c1e16e-119d-48fc-a830-aa1f94263a22","resolution":{"observed_at":"2026-08-06T20:26:11.214442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:10.713100Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.713100Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:f3feac6ca8a6f0a3060820beaefe5ba0bf6e5edceae9caca97177c80c39e9259","observation_id":"7b7f76ba-15ce-404a-af64-b56ee5b4c24f","resolution":{"observed_at":"2026-08-06T20:26:10.713100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-08-06T20:26:10.717650Z","title":"Viewcrafter: Taming video diffusion models for high-fidelity novel view synthesis.arXiv preprint arXiv:2409.02048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.717650Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:2c26d98d797a7a2c214096f71f23565923135381c01ab322d6000910659af33e","observation_id":"6bb1143d-0374-4a2a-993e-ae9ffe2f5bb8","resolution":{"observed_at":"2026-08-06T20:26:10.717650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19586","last_updated":"2024-05-30T00:32:51Z","snapshot_observed_at":"2026-07-06T18:22:22.643181Z","submitted_at":"2024-05-30T00:32:51Z","title":"SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation","version":1},"cited_work":{"arxiv_id":"2405.19586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19586","snapshot_observed_at":"2026-08-06T20:26:10.781815Z","title":"SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation","venue":"cs.CV","work_id":"a1542c94-2dae-4758-ae8e-9f75a9b07b2a","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.722071Z"},"links":{"cited_paper":"/paper/2405.19586","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:9980f6debae17f14d39d4ec7bac87782dcff6ee3fed284991095bcfd033cf560","observation_id":"cfade3f6-0df7-4509-a74f-7ea0d7686a6d","resolution":{"observed_at":"2026-08-06T20:26:10.789431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:11.186473Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":"faab2234-6054-4c0f-8935-47ce1bd02f34","year":2024},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.726682Z"},"links":{"citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:b300349ac848d74d3be173d00ed1468b9509c6ddb89a48e938586731a2019718","observation_id":"ab10986e-163d-4366-9a8b-1d3d8ae937ef","resolution":{"observed_at":"2026-08-06T20:26:11.190957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-06T20:26:10.731298Z","title":"Stereo magnification: Learning view synthesis using multiplane images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:10.731298Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2507.02813"},"observation_digest":"sha256:465e151d9e57e434d66d58e73319fee6cc8c7939b0a52364ca7f49a5497f3978","observation_id":"11aac6ee-99c3-4b6e-b1ce-e88fdc2f7c32","resolution":{"observed_at":"2026-08-06T20:26:10.731298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02813","last_updated":"2025-07-03T17:21:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:00:54.907130Z","submitted_at":"2025-07-03T17:21:23Z","title":"LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2507.02813."}