{"as_of":"2026-08-10T04:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20b35569b47793a56b84f0957c84355ba416baa42ec2e9d904602544fd10153d","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:50:03.404900Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:04:13.707931Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T00:08:43.783077Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"cited_work":{"arxiv_id":"2502.02562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the ropes: Better 2d and 3d position encodings with string.arXiv preprint arXiv:2502.02562","venue":null,"work_id":"1e1e309f-439d-4d78-a5a4-345c1686c549","year":2026},"citing_paper":{"arxiv_id":"2512.07805","last_updated":"2026-05-13T18:33:36Z","snapshot_observed_at":"2026-07-06T22:38:08.821098Z","submitted_at":"2025-12-08T18:39:13Z","title":"Group Representational Position Encoding","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T00:04:13.707931Z"},"links":{"cited_paper":"/paper/2502.02562","citing_paper":"/paper/2512.07805"},"observation_digest":"sha256:f11c242298710b0fa199d26f622d6d2774174abbec02c440e45af48c7ffafc00","observation_id":"cc58e1d0-925c-4e5b-b85e-b14dff6834c3","resolution":{"observed_at":"2026-05-17T00:08:43.785650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"cited_work":{"arxiv_id":"2502.02562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the ropes: Better 2d and 3d position encodings with string.arXiv preprint arXiv:2502.02562","venue":null,"work_id":"1e1e309f-439d-4d78-a5a4-345c1686c549","year":2026},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2502.02562","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:0fc8b886ac8c5da863ee4f8f9dfa6ce9e13f1dae3184bb85ca0c11c224fb0075","observation_id":"ee44d256-fdd5-4292-9a30-5b5d2139851e","resolution":{"observed_at":"2026-05-16T08:27:36.885411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"cited_work":{"arxiv_id":"2502.02562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the ropes: Better 2d and 3d position encodings with string.arXiv preprint arXiv:2502.02562","venue":null,"work_id":"1e1e309f-439d-4d78-a5a4-345c1686c549","year":2026},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2502.02562","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:1a3f69ec33f6b3d3617715cb274eab2eab09f798311c57c6fccc51a9ba899b44","observation_id":"ee280d7c-7ee5-410c-984d-9481b1a87167","resolution":{"observed_at":"2026-05-13T06:07:22.586582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02562/citation-record","integrity":"/paper/2502.02562/integrity","json":"/paper/2502.02562/citation-record.json","paper":"/paper/2502.02562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-07T03:18:17.365096Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-09T11:50:03.173708Z","title":"Round and round we go! what makes rotary positional encodings useful?arXiv preprint arXiv:2410.06205, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.173708Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:319227021cbc86ef7fe1f8a8f95a6535cada8e6dc7ce1ecab3f0f7059260a9e6","observation_id":"01661b05-827f-406d-bb52-5d8bc21b21da","resolution":{"observed_at":"2026-08-09T11:50:03.173708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-09T11:50:03.178588Z","title":"PaliGemma: A versatile 3B VLM for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.178588Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:77fb47312424497984babb184dae04b7faacfa0f419e9fb94c33b05c4269caba","observation_id":"2903a036-e6c9-4cac-b44a-2a59805c6d55","resolution":{"observed_at":"2026-08-09T11:50:03.178588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.182897Z","title":"On computing givens rotations reliably and efficiently.ACM Trans","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.182897Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:13c2d97db895efeb0cebe0dab7c2debc5e5dbd240bcdabee946650c0eedc94d3","observation_id":"5c1107d0-1b0d-4217-a906-3c0e9116bfb4","resolution":{"observed_at":"2026-08-09T11:50:03.182897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03143","last_updated":"2015-02-10T22:46:01Z","snapshot_observed_at":"2026-07-06T04:08:52.584957Z","submitted_at":"2015-02-10T22:46:01Z","title":"Benchmarking in Manipulation Research: The YCB Object and Model Set and Benchmarking Protocols","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03143","snapshot_observed_at":"2026-08-09T11:50:03.186231Z","title":"Benchmarkinginmanipulationresearch: Theycbobjectandmodelsetandbenchmarking protocols","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.186231Z"},"links":{"cited_paper":"/paper/1502.03143","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:0f3c65a69fbc6de5ba484ff129de98ec3854af32ff42060cd701459b2eb6deb1","observation_id":"1ad65f6d-be0b-4e21-973e-18d6c58b6039","resolution":{"observed_at":"2026-08-09T11:50:03.186231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-08T07:48:26.170625Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-09T11:50:03.189919Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.189919Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:5dd783a46223bb697b2b21767d24d8be197256f2c1feb405377f42ecda2a9eb0","observation_id":"a45179ff-a548-46c8-bfcc-2f6311b025a4","resolution":{"observed_at":"2026-08-09T11:50:03.189919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.193783Z","title":"A simple and effective positional encoding for transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.193783Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:0c2abf4b9dfcc135e09e5f529e871f6658cc425686121c1cbfd6ac45671f2735","observation_id":"38cbc3cc-6b24-47a4-b010-7708916f699e","resolution":{"observed_at":"2026-08-09T11:50:03.193783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.187098Z","title":"Pali: A jointly- scaled multilingual language-image model, 2023","venue":null,"work_id":"c562186f-3362-478e-a7f4-f59afc34cb17","year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.197388Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:a97a47431dfc6395ed23d591a1c217d8f5957cf8b063491723aff0f296718fed","observation_id":"4754ac83-8a2d-4dc8-9749-bf405a31106d","resolution":{"observed_at":"2026-08-09T11:50:04.190813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.177951Z","title":"Ramadge, and Alexander Rudnicky","venue":null,"work_id":"d5258a59-e69d-49a7-9c38-ed58d2af3ad1","year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.200668Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:3573cfb523c1b96bd27daa7bb42636f7bd14002719db62920c3224c74ef76b6e","observation_id":"9392a143-8a7c-4baa-a004-98ee72b25db0","resolution":{"observed_at":"2026-08-09T11:50:04.181162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.203875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.203875Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:4fbf5edddfd6e1048539a2431b6fd5e870c320b781dc1fedf22ba731f9f8e67d","observation_id":"30c98a46-964c-4974-adce-62a4f2950f02","resolution":{"observed_at":"2026-08-09T11:50:03.203875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-08T20:36:21.234658Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-09T11:50:03.207085Z","title":"Rethinking attention with performers.arXiv preprint arXiv:2009.14794, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.207085Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:bccbd712647bb7bee62ef597d59750be28179c721fed32835f05a425bd341b3a","observation_id":"35daf527-9d9d-4b54-a808-29056ee9a268","resolution":{"observed_at":"2026-08-09T11:50:03.207085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.162425Z","title":"From block- toeplitz matrices to differential equations on graphs: towards a general theory for scalable masked transformers","venue":null,"work_id":"07b58d5e-7b9a-4e01-b296-e76071dbcfac","year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.211116Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:7ceeedc205b183afd83ebc3cb63fd9984b7dcdc72e1132b3fbae900809ba096d","observation_id":"e8d02b1c-d66f-4f8a-a8c6-5e358272300f","resolution":{"observed_at":"2026-08-09T11:50:04.165870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.214297Z","title":"Abo: Dataset and benchmarks for real-world 3d object understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.214297Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:0ed6534cc432aaf85e7f50f7f47638013e443139e27fe37ad1d81c4ad11bbdd4","observation_id":"f29f77db-481a-48dd-8200-f81c9e95e83c","resolution":{"observed_at":"2026-08-09T11:50:03.214297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.663309Z","title":"Imagenet: A large-scale hierarchicalimagedatabase","venue":null,"work_id":"fc30cdb9-d49b-45ab-8e51-2340ad58cf83","year":2009},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.217429Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:d5008527aa0af3ac0b11cfacef762a525fe8ed4a13037d186d069578a5752d36","observation_id":"b3bc62e0-7b25-4a2d-9d85-1c6911744ad2","resolution":{"observed_at":"2026-08-09T11:50:03.667714Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.220727Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.220727Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:f908a1f2504acf237ba0b0835b8756317f70fc111f73fdf96599a0c1e19ef374","observation_id":"9a96941b-6134-4f56-85fd-f299dbf6bb05","resolution":{"observed_at":"2026-08-09T11:50:03.220727Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.147400Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"95842cd3-7935-4a1d-a377-4945f4fa1250","year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.224085Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:372bad76874d58790f35a1e007579df7cd4dc390bac672568d43ca10d2300416","observation_id":"feb513a2-9f82-4353-8f49-d15c3fe5da49","resolution":{"observed_at":"2026-08-09T11:50:04.150808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.227297Z","title":"Google scanned objects: A high-quality dataset of 3d scanned household items","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.227297Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:119a4f60c2c74687bec32ec1993f57a067fa80950bd316e8be42a0e44790743e","observation_id":"b797224c-680d-4f18-a2e6-256c7438b00f","resolution":{"observed_at":"2026-08-09T11:50:03.227297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T11:50:03.230342Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.230342Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:239792409a574bd9b23ceb53965e1f6cc2f0f90d8ba28f1d7aa2012a6e4992d1","observation_id":"60f5d1f4-486f-4371-96bf-84fdf152dc23","resolution":{"observed_at":"2026-08-09T11:50:03.230342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-09T11:50:03.233540Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.233540Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:ab5c30308a97d672016fb16eccad6f23fe8e7d549fc6a12c04f59696e736e01b","observation_id":"dd51dcfb-c7ea-4809-bb35-92645508b997","resolution":{"observed_at":"2026-08-09T11:50:03.233540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.131999Z","title":"Lvis: A dataset for large vocabulary instance seg- mentation","venue":null,"work_id":"b8839594-94d5-4725-ab47-5d20a4f747a3","year":2019},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.236772Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:7eadfd4b56c998129e9c894a7a4671bc77ce857e1ceee3c4f62562e1d28cd189","observation_id":"95c8f39c-ca1e-485b-a7cb-8ad17fc5b9f4","resolution":{"observed_at":"2026-08-09T11:50:04.135380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.122322Z","title":"Springer, 2013","venue":null,"work_id":"367fc0b5-2780-4c05-938a-20cec04751ab","year":2013},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.239851Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:6bdb66fb9aba8b3436b5f77029b0dc072a6d684a01b9041908e143355f75f150","observation_id":"c0fc717d-b1d6-4c5b-a74b-48829c9e0ed0","resolution":{"observed_at":"2026-08-09T11:50:04.125845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-09T11:50:03.243106Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units.CoRR, abs/1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.243106Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:2b8a5cc3a2957deeb87eac9e75baa39f84d4138387e47b957b25d705206d0eef","observation_id":"d83b7b4f-672b-4ff4-acae-553297a11c95","resolution":{"observed_at":"2026-08-09T11:50:03.243106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.112523Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":"1bfe14b2-afb1-4696-ae3f-0d4f95da5b93","year":2025},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.246708Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:64e5b6dacdcbfba23a42624359f5bb2396a208a14ec8b5f56d5b86bc7f9a0b31","observation_id":"e036886a-5f63-4877-a78f-481dfcfd678a","resolution":{"observed_at":"2026-08-09T11:50:04.116020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1107.1119","last_updated":"2011-07-06T13:04:47Z","snapshot_observed_at":"2026-08-01T06:29:24.752793Z","submitted_at":"2011-07-06T13:04:47Z","title":"Integrating Generic Sensor Fusion Algorithms with Sound State Representations through Encapsulation of Manifolds","version":1},"cited_work":{"arxiv_id":"1107.1119","doi":null,"metadata_source":"pith","pith_arxiv_id":"1107.1119","snapshot_observed_at":"2026-08-09T11:50:03.600318Z","title":"Integrating Generic Sensor Fusion Algorithms with Sound State Representations through Encapsulation of Manifolds","venue":"cs.RO","work_id":"ba4399f3-ddca-4637-acbc-30dcd5b05341","year":2011},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.249679Z"},"links":{"cited_paper":"/paper/1107.1119","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:6f9b4496dc2aedddfbe081465b48398bb718f16c0121e67195044bf78a161a88","observation_id":"5dddd6d1-960f-4a44-9cd4-db1da22ba50c","resolution":{"observed_at":"2026-08-09T11:50:03.605769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.253000Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.253000Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:eed48cd3ddf95141327c1e7dc0c8665ca9242a8b479c5467f3bf5fd8be160d9e","observation_id":"db27b884-be0f-406c-8d19-ab4b53f01f15","resolution":{"observed_at":"2026-08-09T11:50:03.253000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.097299Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":"b09536c5-1f5f-43f9-8d58-cdd922021316","year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.256004Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:49b9b7edea8b2e99d1814b97c695724ab49b5a4f34ae27a07751e09db24388d1","observation_id":"4828a124-57ec-41c0-b3c2-954cfc819a9a","resolution":{"observed_at":"2026-08-09T11:50:04.100569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.088416Z","title":"SHAPE: Shifted absolute position embedding for transformers","venue":null,"work_id":"8db15093-ce89-40de-b2d5-26d04f07fad6","year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.259134Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:7854532ec2f15a7f3bc2c54b155b9298e64f7a2282d56c65b277008d5839f43c","observation_id":"d72693a8-51dc-4418-9532-f45083b5c040","resolution":{"observed_at":"2026-08-09T11:50:04.091625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.079772Z","title":null,"venue":null,"work_id":"8db79e4a-017c-47d8-80ca-0b974f80c058","year":1955},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.265620Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:c6727158dfeba9df06fee006d623f866d1deacbb6642f44b92de71995e7162d5","observation_id":"dbca497e-de5d-4419-9a51-296e25b08732","resolution":{"observed_at":"2026-08-09T11:50:04.082776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.070371Z","title":"Functional interpolation for relative positions improves long context transformers","venue":null,"work_id":"6d32dd1e-fcd7-4d2f-8377-f00a4ae5ed44","year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.268858Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:effe81e7549d58d61142a94969c08855ecd3cddd1ed92d99f0d054181fc8a6e5","observation_id":"3c7cc16f-8254-436c-97dc-378d7ce23ae3","resolution":{"observed_at":"2026-08-09T11:50:04.073695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.061136Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"cab6b9e3-a26e-412c-96e9-f4c51745f938","year":2014},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.271932Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:c8d96dbda5f0771b289b6f5d8fee061dbe1d1ef156a43952d8a02fc60c62beec","observation_id":"44ed6f5a-6f18-4e02-8df3-10a9798d0f90","resolution":{"observed_at":"2026-08-09T11:50:04.064400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.051936Z","title":"Dhillon, and Cho-Jui Hsieh","venue":null,"work_id":"d2a88dc5-c15c-4e63-bed9-4a2fc9469508","year":2020},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.276822Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:b26dd37eee5646ffbf2f399f3a4c53f49f4867197e432d70f35a82711d6d099a","observation_id":"3cd0e8d4-9c06-4c24-bf57-dc1f16f9a8c9","resolution":{"observed_at":"2026-08-09T11:50:04.055219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.042691Z","title":"Stable, fast and accurate: Kernelized attention with relative positional encoding","venue":null,"work_id":"64973b77-f8f4-431d-a597-a6341d052edd","year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.281217Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:357b3c4728fbbdfecab1488119e59b9741708d2f8de731dc702474a6e2df3d84","observation_id":"c3322365-2acd-4f33-8a6e-34e352fb04d7","resolution":{"observed_at":"2026-08-09T11:50:04.045944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.033421Z","title":"Simple open-vocabulary object detection with vision transformers.ECCV, 2022","venue":null,"work_id":"6dddd061-dfe0-4707-868b-fbe4606c21e3","year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.284169Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:a7c1cebd30bd9522385cece8e009cf4bb9964c41cd7122c5196310b27576b83c","observation_id":"06170eb0-3fdc-4c00-8010-862a64278fcb","resolution":{"observed_at":"2026-08-09T11:50:04.036726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10322","last_updated":"2025-08-16T06:26:50Z","snapshot_observed_at":"2026-08-09T21:39:56.778228Z","submitted_at":"2024-06-14T17:41:55Z","title":"LieRE: Lie Rotational Positional Encodings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10322","snapshot_observed_at":"2026-08-09T11:50:03.287163Z","title":"Liere: Generalizing rotary position encodings.arXiv preprint arXiv:2406.10322, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.287163Z"},"links":{"cited_paper":"/paper/2406.10322","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:e7b39981ad818932c25b6579892ac1fe3f476caeb9a003cbc46fbec5b1f2a3a3","observation_id":"b44e797d-4fe2-4681-ac1e-48077e021c6d","resolution":{"observed_at":"2026-08-09T11:50:03.287163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.023573Z","title":"Smith, and Mike Lewis","venue":null,"work_id":"e1a058de-f70b-4ccc-8a8a-07bd0616c38d","year":2022},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.290518Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:251c35db9fdd333fe28d71297d4207d2d9ce6d88e6faede5034a79176c2cf2fc","observation_id":"ea2fd393-80ef-4544-b9f3-b3ac535f57ec","resolution":{"observed_at":"2026-08-09T11:50:04.026940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.013669Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"88da1cdc-ef61-442c-a4c7-550c2d42acc5","year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.293332Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:87548a9eb91eaea8737e7ff5ca5a047bd6473ba0b92dd575fec248d9e1763857","observation_id":"83be2e02-fa45-4f0c-8c4b-57992819da26","resolution":{"observed_at":"2026-08-09T11:50:04.017222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:04.004067Z","title":null,"venue":null,"work_id":"cd183a01-5e82-4748-a8d0-d55623f849db","year":2020},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.296395Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:691a8211b9cebc1c8d11f0c6c7419426b8949265cf62e2172bde54ded407831a","observation_id":"aae62530-0b05-4ec9-ac36-9cc850603448","resolution":{"observed_at":"2026-08-09T11:50:04.007516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03462","last_updated":"2024-10-15T14:12:38Z","snapshot_observed_at":"2026-07-06T19:27:42.862745Z","submitted_at":"2024-10-04T14:24:06Z","title":"Linear Transformer Topological Masking with Graph Random Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03462","snapshot_observed_at":"2026-08-09T11:50:03.299389Z","title":"Linear transformer topological masking with graph random features.arXiv preprint arXiv:2410.03462, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.299389Z"},"links":{"cited_paper":"/paper/2410.03462","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:a23c15e779f79d0e9610ca76361664cff855a51d8ff8419571ff5ca9ce33a87c","observation_id":"224c513e-eded-4c0d-8a51-4b18cad255ca","resolution":{"observed_at":"2026-08-09T11:50:03.299389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-09T11:50:03.302995Z","title":"Code llama: Open foundation models for code.arXiv preprint arXiv:2308.12950, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.302995Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:4c1ec81a94122e2864601c25bc0b538d3d501331bb6c44451ed4f8ddf79f267a","observation_id":"c633c853-5200-4cd1-82a3-c9e37c65ce66","resolution":{"observed_at":"2026-08-09T11:50:03.302995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.993880Z","title":"Recognition of distorted patterns by invariance kernels.Pattern Recognition, 24(10):959–967, 1991","venue":null,"work_id":"5be912de-31db-4688-8e0c-7689f13cb0d9","year":1991},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.306352Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:c34ce53e3a62e513d968de6ac70cde22b078314c09fc5a451693e5c182763aa4","observation_id":"dea00aa8-5534-4ffc-b7f4-0e518a8527ad","resolution":{"observed_at":"2026-08-09T11:50:03.997419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.984384Z","title":null,"venue":null,"work_id":"a7427f7e-c6fe-4ef0-b2a4-289049c27c45","year":1992},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.309418Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:9d05af8346ff06c75223e33fe92720c258436cd22b27ed05c0680d12624b4396","observation_id":"69b32438-0186-4d8b-a79a-f53fc344056c","resolution":{"observed_at":"2026-08-09T11:50:03.987577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-07-06T06:26:51.386842Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-08-09T11:50:03.312598Z","title":"Self-attention with relative position represen- tations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.312598Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:1856ebe93569986cb0447330e0460586775285da5de7760798eb3799e43926fa","observation_id":"4eaf99f7-8c37-4514-930e-d7e335e90efd","resolution":{"observed_at":"2026-08-09T11:50:03.312598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.974243Z","title":"Revisiting energy based models as policies: Ranking noise contrastive estimation and interpolating energy models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"f4cc8cc2-33de-4248-bcbe-8b68dffc6a3d","year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.316236Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:156e63226370f791ca921435ef836a9344e23186201843f0bd84f4a3a1f237c5","observation_id":"d1b94f03-e912-47ca-a458-91242df1b879","resolution":{"observed_at":"2026-08-09T11:50:03.978239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.319128Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.319128Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:9ae8943a7d8b6aee0f33703015e569168284ff008abafb8b06fd61183db7ae7c","observation_id":"dec3afea-03b7-41e9-8a2d-ce33dbdf664a","resolution":{"observed_at":"2026-08-09T11:50:03.319128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.959016Z","title":"Equivariant transformer networks","venue":null,"work_id":"6d4026d1-058e-498c-b0e6-d952e7c192df","year":2019},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.322135Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:7032f71520191bdcf4f6befd243d2eaf19735388e5ca95055621948b01f5742f","observation_id":"61da5423-5193-48ca-a002-8133a2e06cb0","resolution":{"observed_at":"2026-08-09T11:50:03.962470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.949562Z","title":"Early or late fusion matters: Efficient rgb-d fusion in vision transformers for 3d object recognition","venue":null,"work_id":"cd1ba010-3cd6-4efc-bae1-82b6d42d564b","year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.325224Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:7fc0a5440be97e21548fdd8938a6bc194182aa6b0ec9dd44830ed2cc2a5cc14d","observation_id":"5eb222d8-5662-4c41-b37e-208ff861857b","resolution":{"observed_at":"2026-08-09T11:50:03.952946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.328237Z","title":"Divya Udayan, Veerababu Addanki, Sathvik Durgapu, Dhanvanth Reddy Yerramreddy, and Dorasanaiah Kolla","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.328237Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:cfaee27d58f90516084137696e8688fc3c484562395392f7452d4ce23669d70a","observation_id":"a1b73642-818e-4077-9bc7-cca64b6b83b5","resolution":{"observed_at":"2026-08-09T11:50:03.328237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.940518Z","title":"Unity, 2023","venue":null,"work_id":"f9fb53f0-b2ee-4bb0-8b82-689853a2e69c","year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.331260Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:1b50b625b27b3b11daad13c42e9985f928ff9b9a10cfa5d99b5062eb101d081d","observation_id":"00314a30-8e14-4af5-acee-7023dfcc0e60","resolution":{"observed_at":"2026-08-09T11:50:03.943762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.930987Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"d62c3a19-e0eb-4ea5-987c-9345555d949b","year":2017},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.334292Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:0703343fe0e32046590a11bb68065505fdb6d9ac73560f0db770e2a8054547c1","observation_id":"8c1d6b4c-cda6-4816-94d6-57811b2adbe7","resolution":{"observed_at":"2026-08-09T11:50:03.934318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.921696Z","title":"On position embeddings in BERT","venue":null,"work_id":"3716bd16-93af-48fb-a704-6098869504be","year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.337518Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:608c7fda7908cbe2c0777307b34f09e570e0e90d30f0206132f8e4b20fa2b537","observation_id":"7af7f83b-a9f1-4b40-94c3-8d97d0802a2c","resolution":{"observed_at":"2026-08-09T11:50:03.924965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-09T11:50:03.340792Z","title":"Effective long-context scaling of foundation models.arXiv preprint arXiv:2309.16039, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.340792Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:6fda4d1d35b1a82ff7e06b16653f831aad2b29444f42fdc04368596f151e0fdf","observation_id":"deef4fd9-70e1-4e17-9a3e-b4ff77da508b","resolution":{"observed_at":"2026-08-09T11:50:03.340792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-09T11:50:03.344231Z","title":"Depth anything v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.344231Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:e536d17a75de15c7c3f154de7008a76bc72a84a45f21cfecec070918e604ea5c","observation_id":"5c02768f-4688-4434-8e8e-73af0b38d53f","resolution":{"observed_at":"2026-08-09T11:50:03.344231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-09T11:50:03.347634Z","title":"Sigmoid loss for language image pre-training.arXiv preprint arXiv:2303.15343, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.347634Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:67f50e222bc917f95ec9ada715fd1bf7baf83631f5e9c5bd239f122c0ff31722","observation_id":"dab94acc-8b9c-4fa1-9a64-df9800c161cb","resolution":{"observed_at":"2026-08-09T11:50:03.347634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17044","last_updated":"2024-10-06T08:37:05Z","snapshot_observed_at":"2026-08-04T22:47:59.665023Z","submitted_at":"2023-12-28T14:42:24Z","title":"Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17044","snapshot_observed_at":"2026-08-09T11:50:03.351225Z","title":"Length extrapolation of transformers: A survey from the perspective of position encoding.CoRR, abs/2312.17044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.351225Z"},"links":{"cited_paper":"/paper/2312.17044","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:063c91b68558ab17d829a98a174b0d039f950e9ce0311ee6b4a11afd170d8f1a","observation_id":"78e47b44-9be6-48e8-b381-829f300d29c2","resolution":{"observed_at":"2026-08-09T11:50:03.351225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-09T05:00:07.972958Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-08-09T11:50:03.358012Z","title":"1 0 0 1 # if 𝑛 is even, 𝜃𝑛(−1)(𝑛−1)/2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.358012Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:b1ac7f97c54e25d94a6b92f0fc92caa5a2860b57296fb262cc3996ab9f0634ad","observation_id":"4fe7f2c3-bb5b-4f39-8e37-8b1368925532","resolution":{"observed_at":"2026-08-09T11:50:03.358012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.913015Z","title":null,"venue":null,"work_id":"0d5fa349-5983-467b-89d4-f0de8f0f6e82","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.361877Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:944c114542f29f7ea36f19c36a6419494b72ce84428db60012a936313e4970d2","observation_id":"95cd4f16-dd51-4f35-8754-b773f4aa3179","resolution":{"observed_at":"2026-08-09T11:50:03.915945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.904137Z","title":null,"venue":null,"work_id":"1f66b145-f934-46ce-8258-1f5143963a1c","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.365034Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:8778e1f6ed4f9a2924c0931a4c0d347362584287ea62cefd618e25a09078d484","observation_id":"bc0985a7-b5b0-4340-87dd-6a995e52304d","resolution":{"observed_at":"2026-08-09T11:50:03.907363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.895369Z","title":null,"venue":null,"work_id":"a5d5c94d-b060-4a5b-88c3-8e8e80bfd51e","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.368346Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:51a4da773f9a19033f6866ad251fc65bc12acf072c5098ebadd95fd17d9d0c80","observation_id":"2048b349-02d3-443e-9ad7-3a96ad1ac067","resolution":{"observed_at":"2026-08-09T11:50:03.898469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.886740Z","title":null,"venue":null,"work_id":"9749a5ab-313f-4d70-a491-116391794ae8","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.371431Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:1ca5ab0f4625c522d90ca72c22ef644a5981836019043a075cefa99cad120f45","observation_id":"3d390c4e-d7f8-43fc-8a8d-16b1ff13fbd4","resolution":{"observed_at":"2026-08-09T11:50:03.889703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.877793Z","title":"MultiTask aggregates results of all of the above tasks","venue":null,"work_id":"5d8e5e76-d6e7-4bbd-9169-1e07f9ba00f4","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.374386Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:d6b8343fa54344d3130f887b3142868d71c36338117c988fc8ae9b13a285a010","observation_id":"024f88b0-cef5-43b9-89e3-d903663ff466","resolution":{"observed_at":"2026-08-09T11:50:03.881052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.869082Z","title":null,"venue":null,"work_id":"02b63e67-5bcc-4cc0-8d21-528841074ae2","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.377349Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:5a7cbdbc640bc9fcdfedb1ae27c5f435cde837f2bacdce3b9cae27430a97efc3","observation_id":"7e1974ce-2620-4097-b1e7-8d8375899601","resolution":{"observed_at":"2026-08-09T11:50:03.872094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.860202Z","title":null,"venue":null,"work_id":"a31ac58b-5b88-4194-b08e-10984b95778a","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.380313Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:fee93defd6290df8dfadc500b24ea771abc1bc69fe66f7e42511be1c022d24e4","observation_id":"b122169d-40a3-4199-a452-e90562779380","resolution":{"observed_at":"2026-08-09T11:50:03.863398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.850841Z","title":null,"venue":null,"work_id":"a1039133-4704-4992-b999-b2b90b472122","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.383222Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:8e426bcf961986a048ba8870f7df46df2c07b01e136b8ae925af5430ed6a761c","observation_id":"76e4ae5a-ffa5-4bfa-855d-55d7886d1f4d","resolution":{"observed_at":"2026-08-09T11:50:03.853791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.842296Z","title":null,"venue":null,"work_id":"1d5d8809-061e-4c93-996c-1b2964935bdb","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.386083Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:c33de92c9d3da24f984e589e548a2d0689056159c2156cd4f80d8f0dd3335757","observation_id":"ca7350f5-7b11-4f6f-b889-ab1db33fd890","resolution":{"observed_at":"2026-08-09T11:50:03.845253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.832837Z","title":null,"venue":null,"work_id":"ddb5af8b-bb68-4a9a-9481-e3c00e6d4097","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.389111Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:300d754b06eacb18842a7272cc76b526c5d79496a0f6c29a3a845138a1d140dc","observation_id":"ac8f0c27-1312-494c-a4a5-8a9097a906aa","resolution":{"observed_at":"2026-08-09T11:50:03.836345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.823249Z","title":null,"venue":null,"work_id":"cf673be2-24bf-41a9-b061-7172b794c099","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.392494Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:67fa244adef5c4d4de6729cf2836a8af7961383650fcff6b38ac58238995a274","observation_id":"fb5a746f-ee33-4705-892a-3919d0d7f50f","resolution":{"observed_at":"2026-08-09T11:50:03.826548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.814103Z","title":null,"venue":null,"work_id":"9b03696b-1735-40a5-a8be-1f038ec0d352","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.395549Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:dde5b06a630f70f7d4a10c91b30fd422f8907c21e598a41f0ff1bc2c1a50a87a","observation_id":"7b0df1de-41dc-411e-8046-44bbce4edce8","resolution":{"observed_at":"2026-08-09T11:50:03.817226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.804723Z","title":null,"venue":null,"work_id":"3d0fa0cb-9ac0-4fd8-8f41-7efd1ae9707e","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.398572Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:bb44c38eeb4cb759101626350e292c06158a29dfda082a53865a5eba77018f54","observation_id":"71eec2c1-7364-4b43-8eaa-6e7cfe100abf","resolution":{"observed_at":"2026-08-09T11:50:03.807848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.795566Z","title":null,"venue":null,"work_id":"9324a507-db99-4ed3-aeba-1a87a1d362d9","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.401809Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:94e81e42b22d8584ea7c80bf8576670ec92a6ae213d7449cb3e77658c8657dea","observation_id":"7b90a313-72a4-4655-81f9-2354b0b7b73d","resolution":{"observed_at":"2026-08-09T11:50:03.798723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.785722Z","title":"See: Fig","venue":null,"work_id":"ab5e6900-c475-42eb-854e-44b87fb779d5","year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.404900Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:3fa0307df2ca221cfae25ccdec8e00b61a63b90565a2dd508c4317e372bb5456","observation_id":"bb7c1582-560f-4c01-a0ac-07f46aa36b03","resolution":{"observed_at":"2026-08-09T11:50:03.789166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:50:03.262389Z","title":"doi: 10.18653/v1/2021.emnlp-main.266","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.262389Z"},"links":{"citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:9a54572b018dadadaa6f7956a98db7242c519ce00f11c1a141dda4dd5bcb85c2","observation_id":"23445b44-35a4-41e1-ba3b-a89c18ea436b","resolution":{"observed_at":"2026-08-09T11:50:03.262389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17044","last_updated":"2024-10-06T08:37:05Z","snapshot_observed_at":"2026-08-04T22:47:59.665023Z","submitted_at":"2023-12-28T14:42:24Z","title":"Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17044","snapshot_observed_at":"2026-08-09T11:50:03.354747Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.354747Z"},"links":{"cited_paper":"/paper/2312.17044","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:e7904c099f8e4159a343802f04a51f1d5985e2c273a1337eee7e588b2065257b","observation_id":"567357f9-acd8-4295-ad04-922e637d90e9","resolution":{"observed_at":"2026-08-09T11:50:03.354747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:42:18.491712Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 3 inbound Pith citation observations for arXiv:2502.02562."}