{"as_of":"2026-08-20T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc93316e410383893da506519883e8d6df8efa5df6253483016c8110e610d460","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:02:50.657028Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:55:30.013860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:37:36.442163Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2604.18747","last_updated":"2026-06-30T00:24:29Z","snapshot_observed_at":"2026-08-13T18:37:40.094773Z","submitted_at":"2026-04-20T18:52:03Z","title":"URoPE: Universal Relative Position Embedding across Geometric Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T04:17:10.806446Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2604.18747"},"observation_digest":"sha256:39505770a7060726f792159a8f21d16f240bde23ad858b7a8b48de0ec3f020aa","observation_id":"312da80c-c5eb-4cdb-bf33-492dca4f6816","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2605.12938","last_updated":"2026-05-13T03:18:26Z","snapshot_observed_at":"2026-08-16T05:33:19.321519Z","submitted_at":"2026-05-13T03:18:26Z","title":"CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:07:28.493050Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2605.12938"},"observation_digest":"sha256:f75e63cf44e3ef48b49be6c5d19f216e4973bc624ee229a989e92352a1d694fd","observation_id":"02c3a83e-ae25-4dea-94c7-e916896181f5","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.01590","last_updated":"2026-08-19T00:30:07Z","snapshot_observed_at":"2026-08-20T17:27:04.798575Z","submitted_at":"2026-06-01T02:37:56Z","title":"Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:33:51.064212Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.01590"},"observation_digest":"sha256:495414f307906ccdce75ac93672b78ca443443c8e18fd5169b7a377a4f6477b1","observation_id":"131d7a36-4001-48b2-a55d-5a48eebea1c8","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.11275","last_updated":"2026-07-18T15:27:47Z","snapshot_observed_at":"2026-08-15T05:21:00.958658Z","submitted_at":"2026-06-09T09:56:50Z","title":"RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:50:51.534798Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.11275"},"observation_digest":"sha256:ab545049c8f66ed9fb9ec4c4fd9cc264dee9196e46845aa80f449ff56d346e74","observation_id":"b6b4f42a-5282-4ff8-b001-17749fdb66c0","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-08-02T11:55:30.013860Z","title":"arXiv:2601.15275 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11275","last_updated":"2026-07-18T15:27:47Z","snapshot_observed_at":"2026-08-15T05:21:00.958658Z","submitted_at":"2026-06-09T09:56:50Z","title":"RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T11:55:30.013860Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.11275"},"observation_digest":"sha256:8b20587e2f9116b01d3749c8459e746ce5c7e56f20dc24325b88088c9bafa25f","observation_id":"ab1c3669-0f78-42d4-bbb0-5b7e41c03823","resolution":{"observed_at":"2026-08-02T11:55:30.013860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-08-15T04:55:39.194467Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:8553d5a98b26b00f988117b991a4f33a5b1e076f987b6545e08ded2da4bf8321","observation_id":"3b575bb8-b795-41f3-8932-a8909489c1dd","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2607.00417","last_updated":"2026-07-01T04:19:49Z","snapshot_observed_at":"2026-08-14T09:02:39.639181Z","submitted_at":"2026-07-01T04:19:49Z","title":"EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-02T15:18:22.366989Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2607.00417"},"observation_digest":"sha256:3a9b29eb193530c8aef5a91db653dc4db3dc409548f5b80a29257e93383b511d","observation_id":"9d2d883d-7233-476a-aeff-263f0d4f09e6","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-08-01T22:41:46.318816Z","title":"Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, and Song-Hai Zhang","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15667","last_updated":"2026-07-17T06:22:14Z","snapshot_observed_at":"2026-08-16T10:05:20.761585Z","submitted_at":"2026-07-17T06:22:14Z","title":"PE-Field 4D: Video Generation Models as Canvas","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:41:46.318816Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2607.15667"},"observation_digest":"sha256:d1dc289e0e434275bf2374f337c607da7cfe6f1d41602cb30e850d23f2ceb422","observation_id":"aaee9967-1a0a-4fb3-bccf-7bfb9331e625","resolution":{"observed_at":"2026-08-01T22:41:46.318816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.15275/citation-record","integrity":"/paper/2601.15275/integrity","json":"/paper/2601.15275/citation-record.json","paper":"/paper/2601.15275"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.577542Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.577542Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:3e95891987a2fac21078a56ea99d9f399888f73d7ea2813f91f33a517d0f70b3","observation_id":"4fedc77d-b6bb-47d8-bc17-916776865a1d","resolution":{"observed_at":"2026-08-03T09:02:46.577542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.657427Z","title":"Positional encoding field.arXiv preprint arXiv:2510.20385, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.657427Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:2f1e96b5897f2930167ac7516c3928a83d0eecf47105023590b41067b7baf4c1","observation_id":"0f8ed8ab-8de0-43eb-9630-f6babb855e9e","resolution":{"observed_at":"2026-08-03T09:02:46.657427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.701881Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.701881Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:14801921091d49896d0a811861c34e69bab85b446c8668bf6ec12f43b00f6a6c","observation_id":"ff66e488-d1f7-4da3-9654-e54746f473cf","resolution":{"observed_at":"2026-08-03T09:02:46.701881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.809149Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.809149Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:7e4b4a9060af9999b0a69368fade54c8a9a32321396b0d9ca246112401e74b66","observation_id":"0508169d-f037-4e9d-b217-b1d6d8c7371f","resolution":{"observed_at":"2026-08-03T09:02:46.809149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.974936Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.974936Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:24f37396801a173a76450713d40f034e32be92f665ce6bdf74a40bec560b5f1b","observation_id":"d704db9f-a251-4f17-8f85-a374005d3a83","resolution":{"observed_at":"2026-08-03T09:02:46.974936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.042203Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.042203Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:1c85ffe68a98495cf54b025204a8ff003958c0992150477bba6a73d22b944bf4","observation_id":"1566f84d-3315-4d20-8885-eeb5934fc992","resolution":{"observed_at":"2026-08-03T09:02:47.042203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.148988Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.148988Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:ff3f5c0fd380e8e01f75b08cc6cd99e53f89bbb018b993e27a51335d529860ec","observation_id":"73b62937-430b-4fe3-b424-ada6d90446af","resolution":{"observed_at":"2026-08-03T09:02:47.148988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.258000Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.258000Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:2d41c932e0246928cba5da92b50e4811f70f976fbd460ba2eda764841c3fc953","observation_id":"88a2f2f9-8e3d-4731-be73-aead77c4aa8c","resolution":{"observed_at":"2026-08-03T09:02:47.258000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14489","last_updated":"2025-04-01T18:22:54Z","snapshot_observed_at":"2026-08-16T12:48:53.497558Z","submitted_at":"2025-03-18T17:57:22Z","title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14489","snapshot_observed_at":"2026-08-03T09:02:47.336179Z","title":"Stable virtual camera: Generative view synthe- sis with diffusion models.arXiv preprint arXiv:2503.14489,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.336179Z"},"links":{"cited_paper":"/paper/2503.14489","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:0e47f26e68331ddde3b3bfdf41bc6404b08be546af4d77ecef50f701f92a0d73","observation_id":"7927d28a-9024-4db4-a705-dce8a36ecb07","resolution":{"observed_at":"2026-08-03T09:02:47.336179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.413267Z","title":"Cat3d: create anything in 3d with multi-view diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.413267Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d7ca298d608d0ca2487efe60d0dad177391fb8ed3f1dbfdd8d0ca8712b374e0f","observation_id":"02cfe35a-435f-495c-937a-85e8f73fc9f5","resolution":{"observed_at":"2026-08-03T09:02:47.413267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T09:02:47.495902Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.495902Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:dd5c5d619d4f5ad8779b1ccded96adbfefa439e6e95d63dd71c333033f1fc6ef","observation_id":"526ef374-57b2-4901-89bf-8170c488362e","resolution":{"observed_at":"2026-08-03T09:02:47.495902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.573116Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.573116Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:37809c4b4f0422deea021fba191a704a3784720ff613278133dc3fc09d84ddb8","observation_id":"b0273d62-2974-495a-82da-e0fa8bf99bb7","resolution":{"observed_at":"2026-08-03T09:02:47.573116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.715735Z","title":"3d concept learn- ing and reasoning from multi-view images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.715735Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:320a85049127e2ef324147932f1e2cf72a47b8b2fabd31def098fbae33056213","observation_id":"33263900-55fd-43dc-822f-bac23004cb59","resolution":{"observed_at":"2026-08-03T09:02:47.715735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.807044Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.807044Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:c24ecbaf125c1bcc212fe0eef22c2a12e0bc6ff8ce7303520147d85125e060f9","observation_id":"d69f0bd9-e5bd-4362-9d7d-331f07bbc72b","resolution":{"observed_at":"2026-08-03T09:02:47.807044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.867776Z","title":"Odin: a single model for 2d and 3d segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.867776Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:524e4d6faea2d56d1f6a4fd3c0ea0f3c7c3dd0b5d797e8fb5c428751883c290b","observation_id":"2683c12b-4f43-47ad-b98b-8256078444dc","resolution":{"observed_at":"2026-08-03T09:02:47.867776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.946789Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.946789Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f51fbcca70a69174877588a498eb2bda405c51fd98074ed6db2461ac0f6ce958","observation_id":"de6473c4-e766-472f-bda4-aa3b55cebbfd","resolution":{"observed_at":"2026-08-03T09:02:47.946789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.018188Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.018188Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:700e620696228721b27ca298f66cb3802715dac3ef0e09241dc839ada8aca26e","observation_id":"14f2893b-ab7d-47e0-9dd6-3157118045ae","resolution":{"observed_at":"2026-08-03T09:02:48.018188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T09:02:48.094382Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.094382Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:69fddc4af7dc8d50b8fce2f2611c533b4947e4f5f250f0578f3482167222ca6f","observation_id":"70777f5b-784f-4964-ae2a-35647838ed60","resolution":{"observed_at":"2026-08-03T09:02:48.094382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.198169Z","title":"Eschernet: A generative model for scalable view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.198169Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:971eed7eca34abe98df0377338d1d5a778c6d3c0357038c4df56d6be5f9952ef","observation_id":"992865d1-c26c-4e1f-ae07-6d469dca22b3","resolution":{"observed_at":"2026-08-03T09:02:48.198169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.263921Z","title":"Cameras as relative positional encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.263921Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:1cd2c9e618257d1c7f2b8991206b94929cbd10d5198ce17bcfc1c7f514adfc1b","observation_id":"3987ab0b-e73e-4616-9dfe-97cb0c8e2c58","resolution":{"observed_at":"2026-08-03T09:02:48.263921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.353327Z","title":"Learnable fourier features for multi-dimensional spatial po- sitional encoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.353327Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:a34e925f5176d17a5ca14f07f637d9f99975f17af51b9d843d70b46447a9849f","observation_id":"6c1c41a9-d330-4a07-bb9f-5f3269573203","resolution":{"observed_at":"2026-08-03T09:02:48.353327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.421150Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.421150Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f7a8e6657fa30bfb4121a4cbdee09f958f27836083cef88c3c66b2ae97269da7","observation_id":"312d47b2-3f13-44e6-bc9c-50f3b54581ca","resolution":{"observed_at":"2026-08-03T09:02:48.421150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.466344Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.466344Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:a6644f9aff0452f9217e949533e38472eca823072fa7206c0488742cdb0db7ad","observation_id":"1ecbbe76-e3b9-4f93-80f2-957a95207360","resolution":{"observed_at":"2026-08-03T09:02:48.466344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.533366Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.533366Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:755bc5102e3e02bbd8be6b0882d2403268b6a6c2c001cf5591ef13bdb5ddd2f6","observation_id":"394fa997-5a7b-441b-baf9-1bfb35651bcf","resolution":{"observed_at":"2026-08-03T09:02:48.533366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04236","last_updated":"2026-05-03T04:02:22Z","snapshot_observed_at":"2026-08-12T23:09:18.625517Z","submitted_at":"2025-10-05T15:03:31Z","title":"Scaling Sequence-to-Sequence Generative Neural Rendering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04236","snapshot_observed_at":"2026-08-03T09:02:48.574653Z","title":"Scaling sequence-to- sequence generative neural rendering.arXiv preprint arXiv:2510.04236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.574653Z"},"links":{"cited_paper":"/paper/2510.04236","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:43e0855dae9537041f80bf4abf70063bf350a63a1143907b7561b37f44ba5058","observation_id":"f1e39b2e-9f23-49a3-bf8c-f31027718c41","resolution":{"observed_at":"2026-08-03T09:02:48.574653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.642522Z","title":"Gta: A geometry-aware attention mechanism for multi-view transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.642522Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:9d87cf5c1549fdb4928309d75d3badbdb068987ca305d3c4eec3c2154ed9c5bf","observation_id":"a29d31ef-02f8-4866-a956-b715829f5749","resolution":{"observed_at":"2026-08-03T09:02:48.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.686212Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.686212Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:81bf3874ce2cfe25db73695b00bf258d988ee682f149b41d58fb08076443f447","observation_id":"dec8e417-02ce-4b4b-bbc8-8929abe6adfb","resolution":{"observed_at":"2026-08-03T09:02:48.686212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.756145Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.756145Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:968461eac430741dff58679a95826f2f126262ba606e4bbec1eed8d5ff3cbb2e","observation_id":"4710a5f4-c385-436c-a94d-a38aa32f85cb","resolution":{"observed_at":"2026-08-03T09:02:48.756145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.798579Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.798579Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:4de69e3b19047b04da9cc47a802d30326b389f39c3fa92e2acaf1ea3a7bd6229","observation_id":"49d48128-e54a-4fc9-9548-4f6382e25a3e","resolution":{"observed_at":"2026-08-03T09:02:48.798579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.867932Z","title":"Sam 2: Seg- ment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.867932Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:0c735a5709a9f5e8644e92df4f3aae2794cb0a7e21263f2918129180b5d0f589","observation_id":"1a0c444f-39a3-4028-ab09-b670cc5c16cd","resolution":{"observed_at":"2026-08-03T09:02:48.867932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.913721Z","title":"Com- mon objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.913721Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:25177240a3cfebfc6ab9240cecf54ffb7b1c125f7417f14c54f587d8a8858663","observation_id":"a2b60c47-5577-47e5-b29b-71e9f54b84bb","resolution":{"observed_at":"2026-08-03T09:02:48.913721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.983077Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.983077Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:1d3cc0f7ebf4d43bdc64c3a9ee2b60ae7f240cea3dd917227b6df671ac0c077a","observation_id":"d71ef1c1-fec8-46b3-9673-c090d1f5cd77","resolution":{"observed_at":"2026-08-03T09:02:48.983077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.039205Z","title":"Learning the ropes: Better 2d and 3d position encodings with string","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.039205Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f7fd15f8137f159247006071b2dc23372c3639e1a0324d2a945cadf0e46da859","observation_id":"482e906a-523c-4929-9df2-b5f422432fcf","resolution":{"observed_at":"2026-08-03T09:02:49.039205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.077456Z","title":"Self- attention with relative position representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.077456Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:1b43c2205e9153234620a3db73480bcd17099b3487fc6801d5c8662e003bf772","observation_id":"3496c383-93e8-46b4-844c-becfb9e860e5","resolution":{"observed_at":"2026-08-03T09:02:49.077456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T09:02:49.202458Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.202458Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:e95bcf6c28bcab26a207325bdeaf8b9156de823c164f45f95570e1ebdb40670d","observation_id":"d7febf5e-ce5a-46b8-bda4-57f503a47a35","resolution":{"observed_at":"2026-08-03T09:02:49.202458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.361491Z","title":"A benchmark for the eval- uation of rgb-d slam systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.361491Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:227f69d02ae42c3fb2c13bcf3187c1bbc23291eb6f5aaafa9ded8e61b968885e","observation_id":"f275ce28-89c2-49cf-919b-22babc5bd996","resolution":{"observed_at":"2026-08-03T09:02:49.361491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.535159Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.535159Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:42108c3c04bd90ef7d9e337bfe1fe8ae1e5355684ce8393a4c40a8aaa093d507","observation_id":"4db9e846-593a-4a6e-9fac-146bf548f0f1","resolution":{"observed_at":"2026-08-03T09:02:49.535159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.671549Z","title":"Bolt3d: Generating 3d scenes in seconds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.671549Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:ac6b18f18bc1c6c0fbe68fb188225bc3acc56a08f5afd84ec1767f6ebbfc90a5","observation_id":"0b82d22f-153a-48c8-bea3-850666efa440","resolution":{"observed_at":"2026-08-03T09:02:49.671549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.766884Z","title":"Lgm: Large multi-view gaus- sian model for high-resolution 3d content creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.766884Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:97fbe359ae65091bfb39342594ec6054f02a93a095f1c43f37bc37915ad0d109","observation_id":"506dd14e-755c-4163-8697-7471c56d9a94","resolution":{"observed_at":"2026-08-03T09:02:49.766884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T09:02:49.830770Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.830770Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:0ef8b524dc14e4b1cd9cdad075ced44690d4d04151f4b5ee0521d9cbe4d90963","observation_id":"5f4eb199-86a2-43b6-bd67-2f8bff647967","resolution":{"observed_at":"2026-08-03T09:02:49.830770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.943797Z","title":"Ummenhofer, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.943797Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:5ac22cb0c11b6f13085a660edd69195c95a81fba6477ef775e4a21a79bf67063","observation_id":"511a9a8d-5c32-4c9e-9d90-2d08da5d84de","resolution":{"observed_at":"2026-08-03T09:02:49.943797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.995515Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.995515Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:c08b878cf5fe7913d5ad807a04d443807c9fb41eabdd6f43917d2dc5d0e8d4cd","observation_id":"7d2a3f71-7d43-4feb-b6ca-c347a5af888d","resolution":{"observed_at":"2026-08-03T09:02:49.995515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.045626Z","title":"Bullettime: Decoupled control of time and camera pose for video generation.arXiv preprint arXiv:2512.05076, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.045626Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:4f07ef1c1d44211aaf9ee86c866360b660d7b54923a0e59bfa450ec35ee70d64","observation_id":"5b3a6abb-2827-4532-b7d0-de30f3d1250c","resolution":{"observed_at":"2026-08-03T09:02:50.045626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.109414Z","title":"Sun3d: A database of big spaces reconstructed using sfm and object labels","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.109414Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:181b04911d9735f10d79d31c4f3c5fb78d98f89cb7381daf73e41948cf06084e","observation_id":"3000bbdf-f6b7-4e7d-92e3-7a6d08e07f5b","resolution":{"observed_at":"2026-08-03T09:02:50.109414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.150261Z","title":"Unifying flow, stereo and depth estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.150261Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:2d560aa0e61d6bd5c905a85bbba0075b0462934b5ee03d94bff3fdecfefc94f5","observation_id":"53767309-47d5-48e2-a269-4b52e7dcdc91","resolution":{"observed_at":"2026-08-03T09:02:50.150261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.222108Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.222108Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:e7b321308425970b9078cea12d4da9f5a3e4221b74f8506d1d43aaa328662696","observation_id":"6882caf0-e258-4e73-8b1d-2b78acb062e2","resolution":{"observed_at":"2026-08-03T09:02:50.222108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.273214Z","title":"Unified camera positional encoding for controlled video gen- eration.arXiv preprint arXiv:2512.07237, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.273214Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:e005b1b54d64ff5679a6b117135f7ae3341fbb29e33eb0f4489264f0509b2531","observation_id":"43252814-f8b0-4583-a729-8827d84e64a8","resolution":{"observed_at":"2026-08-03T09:02:50.273214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.365186Z","title":"Cameras as rays: Pose estimation via ray diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.365186Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:5a1849aa42b58df24f95413819d2e3f1415519967b461fc38036557fc4a310a6","observation_id":"73da3fa0-1688-4d67-a0b8-c8ab2120040f","resolution":{"observed_at":"2026-08-03T09:02:50.365186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.433950Z","title":"Gs-lrm: Large recon- struction model for 3d gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.433950Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:b624f753568af2251cd56b3641644e74074b350e3fc854958a8b56298bf1f100","observation_id":"c9a6d7aa-da5b-4599-8f81-147a3170be06","resolution":{"observed_at":"2026-08-03T09:02:50.433950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.502760Z","title":"Stereo magnification: Learning view syn- thesis using multiplane images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.502760Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:cf2d336549374e38313fd62ad7178cea13de3d139af750be17483a1e950a8c43","observation_id":"c42d3eae-db78-4afb-90f3-ea17bc05e7bd","resolution":{"observed_at":"2026-08-03T09:02:50.502760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.587541Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.587541Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:de46139217c1546b87a3d4f0cde0d3b355107df456b7bac484d3cd94962f729e","observation_id":"96e5fc36-c429-4027-803f-37f4e8db9181","resolution":{"observed_at":"2026-08-03T09:02:50.587541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.657028Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.657028Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:2d77fca82da40af911d3cc3b8d0febb401bf0479a0f588d8636fd41b8a31a8e0","observation_id":"b23d47bb-5b0b-45d4-9b8a-90ac1eef5acb","resolution":{"observed_at":"2026-08-03T09:02:50.657028Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T10:21:11.461351Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 8 inbound Pith citation observations for arXiv:2601.15275."}