{"as_of":"2026-08-16T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c2d0781f7316620ab792b11ff0e331b0b1cab2caadd32a2911f5ee1cb0d8ede","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:38.878311Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11216/citation-record","integrity":"/paper/2505.11216/integrity","json":"/paper/2505.11216/citation-record.json","paper":"/paper/2505.11216"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"math/9911133","last_updated":"1999-11-18T08:19:58Z","snapshot_observed_at":"2026-07-07T06:11:54.997248Z","submitted_at":"1999-11-17T19:57:11Z","title":"Geometry of oblique projections","version":2},"cited_work":{"arxiv_id":"math/9911133","doi":null,"metadata_source":"pith","pith_arxiv_id":"math/9911133","snapshot_observed_at":"2026-08-15T21:01:39.342405Z","title":"Geometry of oblique projections","venue":"math.OA","work_id":"a4727f8a-553a-480e-805f-0fe33ae43074","year":1999},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.413972Z"},"links":{"cited_paper":"/paper/math/9911133","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d90406ea72332cf13eb9bf997ac3791a0f0543fa12c990fdcd8886c91e251254","observation_id":"66cfa46f-a0bd-4a78-a9c2-e6ee31dbede3","resolution":{"observed_at":"2026-08-15T21:01:39.347568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.420078Z","title":"Vqa: Visual question an- swering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.420078Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d74c214171bf47053db8ffcb625567b633c23e2f49db691844232cdb8b1c74a1","observation_id":"8659d41e-7dc6-4ffd-93b0-1cb8e5a0b684","resolution":{"observed_at":"2026-08-15T21:01:38.420078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.424841Z","title":"Geodesic matting: A framework for fast interactive image and video seg- mentation and matting","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.424841Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:38cb9281afd82dc440213ad1f87cb222985359b55515633aa885c3460fd53344","observation_id":"55c1edf9-c5ee-4ba4-9e2f-9b139486cc82","resolution":{"observed_at":"2026-08-15T21:01:38.424841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.429348Z","title":"Vlmo: Uni- fied vision-language pre-training with mixture-of- modality-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.429348Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:24f1e413fb3453d5a1697fe0a56258a92bc37a6080a6a2218e4b66b2f6cb05d1","observation_id":"b7dec225-807d-4d7d-82d5-77a26f2fff1c","resolution":{"observed_at":"2026-08-15T21:01:38.429348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.434050Z","title":"Grit-vlp: Grouped mini-batch sam- pling for efficient vision and language pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.434050Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ca7faea43acbd5ff8612e1bb8ec13b258563c908c84822ff1834529fe27b7e37","observation_id":"21f0c57b-7496-4784-8aa4-7068f74eefbe","resolution":{"observed_at":"2026-08-15T21:01:38.434050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.438839Z","title":"Mafa: Managing false negatives for vision-language pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.438839Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:bef39a82585a93f091e7630e20e592adb445697b590ee685454874c8fee3712d","observation_id":"7a3ce4a2-f859-4cbe-af60-3c16ac592db2","resolution":{"observed_at":"2026-08-15T21:01:38.438839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.443858Z","title":"End-to-end object detection with trans- formers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.443858Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:0c9ed6035ce1735b7564175f099954844b4b3f92d952b94cb1d1f93c7504e8a6","observation_id":"a48256e5-9822-428d-9acf-0f65b344a5e5","resolution":{"observed_at":"2026-08-15T21:01:38.443858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.448550Z","title":"Un- supervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.448550Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:9464e659635a8a83861f9572bbdce56accdac0e638f9a4bb2d9a5d400fd0951c","observation_id":"db3622f6-0593-4b8f-87af-fff6fcf727bb","resolution":{"observed_at":"2026-08-15T21:01:38.448550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.452997Z","title":"Emerging properties in self-supervised vi- sion transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.452997Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f2ad946fa18123478f91d2194926cfced172d41e1dc067ab208a1299e7228921","observation_id":"fb5ad8ad-31d2-4fa2-a7ab-c9bb930b2de1","resolution":{"observed_at":"2026-08-15T21:01:38.452997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.457508Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.457508Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4b8e70b0d25186138301bd995300de183177320e75f71eb2bcde9d2d3a4e2ec7","observation_id":"99d13011-6d78-4073-b0c4-48eab8b4d2d9","resolution":{"observed_at":"2026-08-15T21:01:38.457508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13081","last_updated":"2023-02-08T02:29:27Z","snapshot_observed_at":"2026-08-13T12:55:02.148160Z","submitted_at":"2023-01-30T17:21:30Z","title":"STAIR: Learning Sparse Text and Image Representation in Grounded Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13081","snapshot_observed_at":"2026-08-15T21:01:38.462143Z","title":"Stair: Learning sparse text and image representation in grounded tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.462143Z"},"links":{"cited_paper":"/paper/2301.13081","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1a0d6909b94fd0d8f5134d9f2cf0cb413ab5156c04ae852a5049036b0103f761","observation_id":"274db597-f706-466c-94af-bff1aab1ab82","resolution":{"observed_at":"2026-08-15T21:01:38.462143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.466898Z","title":"Vlp: A survey on vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.466898Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:fdde3a1cb829dd308f144cda1517ec72c0f3b105dffce534e405ff28e95729b1","observation_id":"65cd4779-0669-4769-8fb5-cf7d80842a14","resolution":{"observed_at":"2026-08-15T21:01:38.466898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.471735Z","title":"A simple framework for con- trastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.471735Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d7c897038ef0ae824c1218dae612a1c3182431556579f4748ecde61b377ba086","observation_id":"2fe0d320-69d6-4761-914f-af8965a929be","resolution":{"observed_at":"2026-08-15T21:01:38.471735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.475985Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.475985Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:119777c74a09464672bad2f9a52771dbeecdaf5807367d4ba3bdf38c22eb3719","observation_id":"004bccc6-a759-477a-b537-6ce78ea73233","resolution":{"observed_at":"2026-08-15T21:01:38.475985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-15T21:01:38.480255Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.480255Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d62f89d082db1772c3dced68a0805b099a268b59b37fddeb6af69617d82892bb","observation_id":"4196cc9e-1fce-4152-ae6c-f046f859e2b4","resolution":{"observed_at":"2026-08-15T21:01:38.480255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02253","last_updated":"2021-06-07T09:03:46Z","snapshot_observed_at":"2026-08-13T19:10:09.499335Z","submitted_at":"2021-06-04T04:32:02Z","title":"X-volution: On the unification of convolution and self-attention","version":2},"cited_work":{"arxiv_id":"2106.02253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.02253","snapshot_observed_at":"2026-08-15T21:01:39.289487Z","title":"X-volution: On the unification of convolution and self-attention","venue":"cs.CV","work_id":"c172543c-a80f-41de-afcb-714860f17f71","year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.484805Z"},"links":{"cited_paper":"/paper/2106.02253","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:cd2859ca201adafe9b6658f06c5a74ad701479620f39db48d832d347acb92634","observation_id":"8adae875-cc7c-4b7c-959d-a92eeedff320","resolution":{"observed_at":"2026-08-15T21:01:39.294667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.489680Z","title":"Uniter: Universal image-text represen- tation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.489680Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f6a921906998b2114650264944657f3dff0e32ad8b1d3417b0dd60180c1b71d3","observation_id":"ad3267df-c538-4ee7-b467-0337bcb55ec6","resolution":{"observed_at":"2026-08-15T21:01:38.489680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07496","last_updated":"2023-11-20T15:57:43Z","snapshot_observed_at":"2026-08-13T14:25:35.024825Z","submitted_at":"2022-09-15T17:37:08Z","title":"Unsupervised Opinion Summarization Using Approximate Geodesics","version":3},"cited_work":{"arxiv_id":"2209.07496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07496","snapshot_observed_at":"2026-08-15T21:01:39.259921Z","title":"Unsupervised Opinion Summarization Using Approximate Geodesics","venue":"cs.CL","work_id":"d406bb59-1708-4fcd-b053-efc8eeb842a2","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.494361Z"},"links":{"cited_paper":"/paper/2209.07496","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:737b9c19eb4fcdeb5ffd6e1a7d058397b53c15f4fcf41b5ebf3be2707deb170c","observation_id":"b5b4d7b4-0948-4db1-bff5-bb6998010a34","resolution":{"observed_at":"2026-08-15T21:01:39.267081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.499121Z","title":"Geodesics in heat: A new approach to computing distance based on heat flow","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.499121Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4403577d98731fe61d792605639c2fbb0c0d7ca57b3cbf13e588f5fea9aa9f75","observation_id":"54f20193-659f-4878-8e05-b9d15bf37185","resolution":{"observed_at":"2026-08-15T21:01:38.499121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.503671Z","title":"Imagenet: A large-scale hierar- chical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.503671Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:399d66c6279000c630e89ea55ccc2e7a8469e6158a75f4caa2da61f894951309","observation_id":"3478c4dc-1800-4b8a-8fa1-150a8fac611b","resolution":{"observed_at":"2026-08-15T21:01:38.503671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T21:01:38.508186Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.508186Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:60e4e40a07565efb30475af4d332506c39a91767a0f52b259ea07e40f4dfef05","observation_id":"b6a0e3ef-a335-403a-afe0-dea09844afcb","resolution":{"observed_at":"2026-08-15T21:01:38.508186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.512748Z","title":"Similarity reasoning and filtration for image-text matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.512748Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:6f22761692d52025e090209dad29f8f53fd4db2ee564a2508aa7b223460268a4","observation_id":"563e7ed6-9e23-49c7-8249-556a7a4e2d39","resolution":{"observed_at":"2026-08-15T21:01:38.512748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.517378Z","title":"A note on two problems in con- nexion with graphs","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.517378Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3a4df792373c2285023ad7597669214755ae90918c6fbdc1b53f60f8260693fa","observation_id":"8ede5920-4d59-4b00-996e-06fa677e62b4","resolution":{"observed_at":"2026-08-15T21:01:38.517378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T21:01:38.522500Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.522500Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3eb1a2012c65fa24a7000364875e7257a0101e2331c4acedb7977fa73b428274","observation_id":"2bf51a31-6b6b-42d0-a3bf-253e0f9ca610","resolution":{"observed_at":"2026-08-15T21:01:38.522500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.528050Z","title":"Algorithm 97: shortest path","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.528050Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:8d703ab94cdece48981706624b40e60ef6bde85e4b1f696774edbdf518dbab8a","observation_id":"31a91c94-7b3c-49b9-b09a-29f0d3911a19","resolution":{"observed_at":"2026-08-15T21:01:38.528050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.532702Z","title":"Large-scale adversar- ial training for vision-and-language representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.532702Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:fd2c64efe169dff3bbc1f1c148f0552c763f0638a8fb1ca785ba4933ed5a082c","observation_id":"3ef1901e-d388-47be-9797-5288ce17d716","resolution":{"observed_at":"2026-08-15T21:01:38.532702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.537300Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.537300Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3a1253e44f3e8ee57819c0c49ad40df45b9801771b132e8bfd3fadd299bdf90d","observation_id":"94e9c6b0-76e3-4cfc-825b-3ce545cc4019","resolution":{"observed_at":"2026-08-15T21:01:38.537300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.541805Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.541805Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3cee7fe691c0ae0fca4bb35e24d5aeca397c1ab2e85ab1fb56aab13f8939e6b0","observation_id":"53a7fab5-efb6-4ff8-bbec-c2242f7cbfc4","resolution":{"observed_at":"2026-08-15T21:01:38.541805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.546457Z","title":"Masked autoen- coders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.546457Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3533fedfcd4d10b014be745d42a18f138f337ed29b92b0c7ccabd0209d3329ee","observation_id":"a3f9074b-fbab-445c-a06a-d73412d91706","resolution":{"observed_at":"2026-08-15T21:01:38.546457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.551765Z","title":"Geonet: Deep geodesic networks for point cloud analysis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.551765Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e05204d44f5a24ee71a9854af93d4e058a68a147c25a906d707ae1ff3bb3083e","observation_id":"fc0aedf2-1406-4814-93fc-e27dac959f1f","resolution":{"observed_at":"2026-08-15T21:01:38.551765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-15T21:01:38.561792Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.561792Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ac30ef219ae826d18f639c5d81546bfbd09aef7bf27c3c3acb0bb6523a66399d","observation_id":"276fe121-e048-4455-a1f0-4be44f6352e2","resolution":{"observed_at":"2026-08-15T21:01:38.561792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.566170Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.566170Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:2a20a1df60eac78df2656c9a0411ac89ad5330ce3dabb8236250867c2bd68b96","observation_id":"8ab911b9-f86b-4331-9caf-a74d29e77a59","resolution":{"observed_at":"2026-08-15T21:01:38.566170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.570688Z","title":"Vilt: Vision-and-language transformer without convolu- tion or region supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.570688Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:bdd0af7acc580750b51421c4bda11ca90bfbd12dcc28b880f7a0e30890fc7e31","observation_id":"4da22129-6ec5-4438-9d0f-38cac98f3077","resolution":{"observed_at":"2026-08-15T21:01:38.570688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.574725Z","title":"Computing geodesic paths on manifolds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.574725Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f2bfbd539ed826e760eb10e538eba76964fa8e72063e63e2c7ed46e47a10e944","observation_id":"43dd0a4b-2483-4364-90ad-ed7f8b51290b","resolution":{"observed_at":"2026-08-15T21:01:38.574725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.579261Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annota- tions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.579261Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:42e5121e271b7b2908663e026846f6b7712a12bba6d8708506150db2389c2e1e","observation_id":"27c0734b-23d0-43c1-9612-5e6207f46290","resolution":{"observed_at":"2026-08-15T21:01:38.579261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.583852Z","title":"Numba: a llvm-based python JIT compiler","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.583852Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:8a8b58b48644eab16a82c05e1164e0f9a523c0e9da524a347d8936173e5eb6c4","observation_id":"7e43bedb-4f44-468c-bcf5-b3c469f4d285","resolution":{"observed_at":"2026-08-15T21:01:38.583852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.588469Z","title":"Le, Vu Nguyen, Chen-Ping Yu, and Dimitris Samaras","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.588469Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:45b64dabc90b8dd482af6fc57ac7397a5f97ea6ebc7be3613f98fe3c258a222a","observation_id":"aa33debf-79a4-4188-b5a2-4d393a1c1ee8","resolution":{"observed_at":"2026-08-15T21:01:38.588469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.592895Z","title":"Stacked cross attention for image- text matching","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.592895Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d4a0702f170be98fe20c974f3a65b5af92bc3f56ca1d2f51fcdf396b99bcd8c4","observation_id":"46ea7ca2-464f-42cf-bda9-8f1d75c8caee","resolution":{"observed_at":"2026-08-15T21:01:38.592895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-13T10:10:39.294234Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-15T21:01:38.597292Z","title":"Multimodal foundation models: From spe- cialists to general-purpose assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.597292Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e5829572c092d615ee68395301635e636272611d9d1ba31ccb77d6b09b118f31","observation_id":"23f519ed-53c6-45ae-a6e6-f7b0681e5b9d","resolution":{"observed_at":"2026-08-15T21:01:38.597292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.602455Z","title":"Align before fuse: Vision and lan- guage representation learning with momentum dis- tillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.602455Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1fbe3998a32a01b3c64dd49217787273c50fae6bd3edc83bfbb3776e8bc7b4be","observation_id":"71eddf66-8905-4e23-8355-6cd0d419bc8e","resolution":{"observed_at":"2026-08-15T21:01:38.602455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.186664Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"7e7fc2e7-fc26-4b6d-a556-58baca0cfe7a","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.607159Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:292468ea1bb3f140648fa3205d4116981102b5aacaa6923115bbb7ccdf349f99","observation_id":"f3f7b385-b0a0-4dbb-88c2-1a9fd92507e0","resolution":{"observed_at":"2026-08-15T21:01:40.191284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-13T09:35:23.538598Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-15T21:01:38.611677Z","title":"Hero: Hierarchical en- coder for video+ language omni-representation pre- training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.611677Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5d0558c6239f0df955e8badf9e029b6aa26f52fbc6d99eb81f3225a11be47d0b","observation_id":"365af228-59ce-46e0-ae1c-7e91497c43c6","resolution":{"observed_at":"2026-08-15T21:01:38.611677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-15T21:01:38.616515Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.616515Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:87139d772a391044bbbb7ece4e5d6af71e7f26def89934d74b90afe38728faf3","observation_id":"4cb98fbf-d047-4e6d-bfcd-bb8854344691","resolution":{"observed_at":"2026-08-15T21:01:38.616515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.172550Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"79389415-ac36-4199-89f7-8e078e758494","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.621318Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:556601cd5fe3197979324516de7755d1216ad2674c8a18f72dda41f0dc362c91","observation_id":"4d8b67ea-7b08-4c7a-89fb-c7d019169cfe","resolution":{"observed_at":"2026-08-15T21:01:40.177109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-16T08:46:01.519316Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-15T21:01:38.625976Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre- training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.625976Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:aa4a23e58fa46f358e6cf8f2c761a92e82b4f64acc56958612e16c8b569798ea","observation_id":"b18e0303-3dcd-4727-b2b8-c843df5c473e","resolution":{"observed_at":"2026-08-15T21:01:38.625976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.158697Z","title":"Scaling language- image pre-training via masking","venue":null,"work_id":"7235ccdf-7f6c-47e0-b520-dc3b923e2d17","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.630755Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d105982a782d132e3b006868e8b51b161667c32c753f68115f3d5d1b0fff85ce","observation_id":"c4cc866d-c672-4f5d-9e80-c0fa2e1bc243","resolution":{"observed_at":"2026-08-15T21:01:40.163177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.144302Z","title":"Geodesic self- attention for 3d point clouds","venue":null,"work_id":"6daba089-484c-4aac-a6ce-74ea04a067b1","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.635022Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f498c41e63ca2054279fba58e0d9c2e5557df015095ada9f60657da92af3d90c","observation_id":"9254e8d4-3858-4246-a97a-f3fa3252d5e7","resolution":{"observed_at":"2026-08-15T21:01:40.148944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.127837Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"03e4b030-7772-497a-bd95-19e66b052b06","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.639316Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:eba9f3210f57d04f81c06ef9cd0050a772c7df91f12495b5f46e64be097deee7","observation_id":"06178822-4c25-4d71-a750-3cdcaa1e655d","resolution":{"observed_at":"2026-08-15T21:01:40.134318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.113244Z","title":null,"venue":null,"work_id":"e1936f33-bb0c-4735-9d12-a6a0f3ae54c6","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.644092Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:cc7914616834fd3e5ad632d982b757729dc24e9fe9004ff4a09ae4d15cc2f3da","observation_id":"60a9f332-f09a-4b03-abb3-693a13838ba4","resolution":{"observed_at":"2026-08-15T21:01:40.118132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.098122Z","title":"Adap- tive reconstruction network for weakly supervised re- ferring expression grounding","venue":null,"work_id":"6b8d3f3d-e84b-4b6c-be68-87725b081909","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.648566Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ed456cce5d297b6988776b3f15ac70c4be8739a037ff0e7d4fac9809087941e0","observation_id":"39a9358a-fce3-4c28-a839-3c9deeedb799","resolution":{"observed_at":"2026-08-15T21:01:40.102936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.083767Z","title":"Algorithm as 136: A k-means clustering algorithm","venue":null,"work_id":"7dcc36d4-2b2a-4a6e-8d6e-8e58396f2e32","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.652851Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d9f764c886af3d7ba50a4bfb471e380bb9bce5f41a1e294c895d9da90c717878","observation_id":"2351d9c4-6ef2-45fb-8709-8d500a8fbb70","resolution":{"observed_at":"2026-08-15T21:01:40.088456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.069323Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"6127b72e-1849-4600-a00f-ef7ef1f2bebe","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.657146Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:45c02cf8d51635dc83dac09d2a6ca8b1a583bc4d0423d8af14d7debc3719b8ab","observation_id":"4d014c8a-5557-4533-8c80-b64489b474eb","resolution":{"observed_at":"2026-08-15T21:01:40.074084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.054536Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic rep- resentations for vision-and-language tasks.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"658bc405-acd9-4215-9692-4b5e698d78b9","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.661372Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3546c6003fed06ab5d496efcddab352fbe710c76469066a255076d16aaf0a5a0","observation_id":"fe50d3e3-97e6-4ba1-989f-c0f4b8c4e66e","resolution":{"observed_at":"2026-08-15T21:01:40.059524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.037761Z","title":"Computing geodesics on triangular meshes.Comput- ers & Graphics, 29(5):667–675, 2005","venue":null,"work_id":"f14bdf5a-c781-4982-9537-4162f2470527","year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.665984Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d97552bacea3ab92e380f1ef87785a0654c39c1beafdb8df8026b6f9c003d47e","observation_id":"5246da00-04c3-45f3-8e9a-2f135549850b","resolution":{"observed_at":"2026-08-15T21:01:40.042868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.022360Z","title":"Bron- stein, and Pierre Vandergheynst","venue":null,"work_id":"d9cc5661-d5bd-4098-9d4f-0e019f92df93","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.670412Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:894f4b4ba7ba9d536e26bedcda93969b0102d010eef4debd9970f31557cc2893","observation_id":"b5cd8895-692e-4312-9a36-eb02c979757c","resolution":{"observed_at":"2026-08-15T21:01:40.027471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.006175Z","title":"Jensen’s inequality","venue":null,"work_id":"06fee18d-c045-4ea3-82ed-f24fbd0f55e8","year":1937},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.674622Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:06f421e459bd3a757cee8d7b2d8f1ed43b2cc016466fdc37f1513eb0e6447d2d","observation_id":"db0dae6f-1b92-491a-9eec-622b4be87742","resolution":{"observed_at":"2026-08-15T21:01:40.011409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.990691Z","title":"Towards bridging sample complexity and model capacity","venue":null,"work_id":"11803809-0de4-4883-b57e-d5f9910f94d0","year":1972},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.679359Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:83ec44cb6d955e742d68e82860b047b219fb281d0d3767097d0abe7847b768a6","observation_id":"53b6afc6-3b03-4001-99e5-aa01f5ddb3f2","resolution":{"observed_at":"2026-08-15T21:01:39.995610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.975583Z","title":"Towards interpreting and utiliz- ing symmetry property in adversarial examples","venue":null,"work_id":"6bb3b1ad-5a34-4627-8f19-d3d64ad20d0a","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.684246Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:26b17a6ed330a7135b5e3f2d504aea57917ff53289cdbcc518e247d4fbd8af98","observation_id":"037bcfe0-7300-451f-8c0e-90acd50e9d26","resolution":{"observed_at":"2026-08-15T21:01:39.980284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.960756Z","title":"Exploring and utilizing pattern imbal- ance","venue":null,"work_id":"990b1c82-5bd6-455a-8934-a6be375c3964","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.688557Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:9f0d2643d8e68396143d79f730036c5c1e06ff7e443a152a1e47baebc6080360","observation_id":"eb72ad7e-e4f0-4cb7-ac55-d7d92f501aee","resolution":{"observed_at":"2026-08-15T21:01:39.965557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11562","last_updated":"2024-11-18T13:32:59Z","snapshot_observed_at":"2026-08-12T18:20:03.057276Z","submitted_at":"2024-11-18T13:32:59Z","title":"MSSIDD: A Benchmark for Multi-Sensor Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11562","snapshot_observed_at":"2026-08-15T21:01:38.693131Z","title":"Mssidd: A benchmark for multi-sensor denoising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.693131Z"},"links":{"cited_paper":"/paper/2411.11562","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:cdcf77aa2c5a957ededb9f9c1da530e87c3a2ffb7cea9967efbd41a4ecb86199","observation_id":"fc249f86-bb9e-4169-b426-df1f88ff3b4b","resolution":{"observed_at":"2026-08-15T21:01:38.693131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.946107Z","title":"Object- oriented anchoring and modal alignment in multi- modal learning","venue":null,"work_id":"19590422-6dbf-419a-b229-a2aeaec0c147","year":2025},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.697887Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:515ca4d612da8e816b5f2a28ce7b664921f42fccbe159555757d9874bde29c18","observation_id":"8667fbc0-cf70-4172-a709-7e11fe756667","resolution":{"observed_at":"2026-08-15T21:01:39.950715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.931887Z","title":null,"venue":null,"work_id":"0bc0a5d8-6c73-4a34-8296-b92b25cd3190","year":1987},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.702453Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3b788ba7f40f953a6fe5e21f18398acbb516a12014b5594a3b9b2fa3751cf5d8","observation_id":"ab70750a-7f52-41d8-b35d-9c13d9cf1988","resolution":{"observed_at":"2026-08-15T21:01:39.936600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.917259Z","title":"Analytic inequalities","venue":null,"work_id":"edbd965a-4519-414c-b7c2-317ec5d7441f","year":1970},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.706836Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:87fca3c0185fa7d51ad19c3ba7baa2030b072dad8eebb7f5a6f02026a4d69912","observation_id":"dfa2bc74-bcff-4279-9090-48d22c9a014a","resolution":{"observed_at":"2026-08-15T21:01:39.921950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.902201Z","title":"Slip: Self-supervision meets language- image pre-training","venue":null,"work_id":"5f2c9371-7da8-4982-b6bf-11d07dca6230","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.711315Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e24d9a6bb9db6a755a89f080d71d7a012ca12ea89d03ea1dea2332a755cdb65d","observation_id":"779b1cb0-4418-4c9a-b5ee-c5bbc4d44e24","resolution":{"observed_at":"2026-08-15T21:01:39.907114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.886059Z","title":"Geodesic-former: A geodesic-guided few-shot 3d point cloud instance segmenter","venue":null,"work_id":"387801d8-8acc-41e7-82f7-87673cbe8933","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.715810Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d3a57438d6facb92cf9d698425845be14437d5086cd13fd21c37eef16e304b6e","observation_id":"fa827551-edcc-4c9e-9912-3714a5411439","resolution":{"observed_at":"2026-08-15T21:01:39.891302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T21:01:38.720127Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.720127Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:77549e557bfc525ebe2531030aa17db5201b9ad59935092fe9f12f9f451a5eb6","observation_id":"365b3a40-91df-420d-8e36-a9d33cf78743","resolution":{"observed_at":"2026-08-15T21:01:38.720127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.870320Z","title":"Im2text: Describing images using 1 million cap- tioned photographs","venue":null,"work_id":"33d35920-a01a-4ce5-aa23-5d3ee141de2b","year":2011},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.724243Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1dfec8056d2db08c16a120dbfdc0017b260a444df8face93f1140d57a6738278","observation_id":"02cfc387-40af-4776-aaca-1ce14fa83ce9","resolution":{"observed_at":"2026-08-15T21:01:39.874796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.855684Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"e2ee8241-8def-4f26-9052-ba12b754e07d","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.728504Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:17d4dfc6399ffdefc7214e1f49db0416c07790a527266d1cd7805e6e76763858","observation_id":"c050648a-b3e4-47df-b98c-50d09c10e2f9","resolution":{"observed_at":"2026-08-15T21:01:39.860351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-13T14:45:57.387723Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-15T21:01:38.732801Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.732801Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d583ff04cbf1b778c284dddaac6ca2fe626cc378afa2b7eb61aad28903655d7c","observation_id":"cdca1922-b4c5-44fe-b249-9b550c72b70f","resolution":{"observed_at":"2026-08-15T21:01:38.732801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.841218Z","title":"Computational optimal transport: With applications to data science","venue":null,"work_id":"daa02951-4c52-41ae-9049-2fd8ac7e5bd6","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.737328Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ea1e707bda6b9155f8edba2ceee6b29febb18074ae9de1da71c055f397669ff9","observation_id":"963c7e38-774e-441b-a3ab-26fa8a413f82","resolution":{"observed_at":"2026-08-15T21:01:39.845941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.826584Z","title":"Combined scaling for zero-shot transfer learn- ing","venue":null,"work_id":"8d6b43e8-1d47-46f5-8fb4-909f19693189","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.741852Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:19122c63630bf7400eac69035c0909b6dad9adf8b2a1074df5ac58d586948b85","observation_id":"b1c8fd83-b920-4b38-bd53-203dd2f7e424","resolution":{"observed_at":"2026-08-15T21:01:39.831296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.811827Z","title":"Flickr30k entities: Collecting region-to- phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"b1f858a6-7dc4-4aeb-a0bc-0f9f5f0237b4","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.746508Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3098e71b94ff7b2b1254f48f202833c05ae8a98efb7620127aeb5cac8d212e83","observation_id":"a45f9e51-ef3b-4c23-9477-b6dc223754f4","resolution":{"observed_at":"2026-08-15T21:01:39.816611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.796323Z","title":"Straightest geodesics on polyhedral surfaces","venue":null,"work_id":"c8f785ac-5318-4113-99a3-b3c2d6698715","year":2006},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.751231Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:758f46003a5c408548bcea155b07661e6f540d2cef5519a8fef82f3bc72266c3","observation_id":"3aa8b2b5-f6c8-432a-bfad-9389940629e9","resolution":{"observed_at":"2026-08-15T21:01:39.800960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.781652Z","title":"Graphwalks: Efficient shape agnostic geodesic shortest path estimation","venue":null,"work_id":"c3e4a8c2-5813-4479-b5a7-a9008352a8ee","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.755787Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ec375307ffeb31cf69f5089f52e6ded414d08b6fbb9d296d0e015b2845866335","observation_id":"69d4cb8f-1a1c-4d7f-beaf-ea39ec9da25a","resolution":{"observed_at":"2026-08-15T21:01:39.786494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07966","last_updated":"2020-01-23T08:03:27Z","snapshot_observed_at":"2026-08-13T04:05:30.435237Z","submitted_at":"2020-01-22T11:35:58Z","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07966","snapshot_observed_at":"2026-08-15T21:01:38.760337Z","title":"Imagebert: Cross-modal pre- training with large-scale weak-supervised image-text data","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.760337Z"},"links":{"cited_paper":"/paper/2001.07966","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d72d6398c13ac2a2a8cf0ce6e0b8968f73e4926ec91ec493c873c20d39c13378","observation_id":"83ece59c-1713-4f08-9db8-d05488a96e43","resolution":{"observed_at":"2026-08-15T21:01:38.760337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.766207Z","title":"Improving language under- standing by generative pre-training","venue":null,"work_id":"f1de6b15-ccde-4140-b565-ddd0a2a4892a","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.764854Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:560134a6db22f2e4cc9319c1342ec2fddca735893fd3851c840dc1169c293445","observation_id":"b91a6b2b-8976-4bc4-9df4-028ed954f459","resolution":{"observed_at":"2026-08-15T21:01:39.771893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.751420Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a50daa93-bf62-4ef7-a28e-3643d2608e5f","year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.770102Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5379dbea12c7280a9b6422b8940569b5b19c2dfa945f728fbf75e8c7e236ca5f","observation_id":"cf238571-3c66-4790-a28d-b0db7bb9eb3c","resolution":{"observed_at":"2026-08-15T21:01:39.756264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.735278Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"85bee4af-f375-4ee8-905f-ed4c1865c501","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.774550Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5b255f7ea3fc1efd47b2748666c090e09f46d8e8d1e08e5a4896e558e85bc95c","observation_id":"34b842d2-b60f-445a-a601-22e99fb888e9","resolution":{"observed_at":"2026-08-15T21:01:39.739955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.719292Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"387185ef-40ec-4431-b11e-5793e667b099","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.779246Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:88e6b1d1de6043e0f352645f0daf16a23e9359f06e6ac84bae33023ab1de0420","observation_id":"8da1e150-ae73-490d-a9c7-3157e38dbdf1","resolution":{"observed_at":"2026-08-15T21:01:39.724753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.704281Z","title":"Conceptual captions: A cleaned, hy- pernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"1b29f9c6-5731-4618-8418-07e0be0ee812","year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.783626Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:a5f128e592eb8d6437988d719a31121d6ffaa09f163ee78ab05d112aeecb4d59","observation_id":"71a53bd5-3456-4d4e-aa00-1ceb46daee9c","resolution":{"observed_at":"2026-08-15T21:01:39.709325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-15T21:01:38.788840Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.788840Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d324d40752ac6afc8932ddba361e0bd04924fa9945761dcf01e4ffd07eb5b87c","observation_id":"ef6e53a7-c2d1-4362-8650-182f8a060ede","resolution":{"observed_at":"2026-08-15T21:01:38.788840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-15T21:01:38.793508Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.793508Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:48ccb0cb1234de8006cd513a0ac308c34689124557879349515a3a4f75526870","observation_id":"37bb562b-fa2e-443f-b0de-ce00af6ef2dd","resolution":{"observed_at":"2026-08-15T21:01:38.793508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-15T21:01:38.798297Z","title":"A corpus for reason- ing about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.798297Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:dc6656fa2a998663cd082ce60aaaa10c00db7f9d21393621ab121657ac84c907","observation_id":"2d304298-9594-4627-bfbf-0b7daf9418fe","resolution":{"observed_at":"2026-08-15T21:01:38.798297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.690089Z","title":"Revisiting unreasonable effective- ness of data in deep learning era","venue":null,"work_id":"1ec6e2b2-91d6-441b-9eee-d4b2af376ea9","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.802864Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f64709c7b1534d97ef3602e3bd85e047a17ddc1637bdc5a33d629958767615fa","observation_id":"140a7beb-1be5-4a53-ad80-278df7e9ca50","resolution":{"observed_at":"2026-08-15T21:01:39.694704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.674206Z","title":"Gortler, and Hugues Hoppe","venue":null,"work_id":"0714001b-9467-4402-a4d6-6568ce20e807","year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.807626Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c4251227d814f232431cf9c28ad0181fda5bb0a1c8194374d3696cbfee4a470d","observation_id":"80e6a150-979d-4e34-96b5-8e289fb4060b","resolution":{"observed_at":"2026-08-15T21:01:39.680072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.660015Z","title":"LXMERT: learning cross-modality encoder representations from trans- formers","venue":null,"work_id":"814ab457-0ad1-4f2a-a8ff-723e762a6530","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.812216Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:04f54d44496fae01a493ae3eac92ddee57e6d9638953e049532e07e556495e8c","observation_id":"71871314-e8da-4eb1-821a-1a4f8785f83e","resolution":{"observed_at":"2026-08-15T21:01:39.664840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.645601Z","title":"Tenenbaum, Vin de Silva, and John C","venue":null,"work_id":"3095ee81-e923-4029-a1f9-fd1fc3aa9f8d","year":2000},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.816540Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:292f2a9aad42580dc09958f78d5214e8deb17e2507e84274fa0e88a89520ef01","observation_id":"06bf8c74-6ea4-4cce-afc8-ea3c2782f5ee","resolution":{"observed_at":"2026-08-15T21:01:39.650272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.631330Z","title":"Pigeon hole principle","venue":null,"work_id":"7d9d78ef-1b81-41f4-b513-cdecaf4eb296","year":1990},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.821250Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:b637dd7384be8e39464f2e562dacd4006ee4918b866e4e03aa21e7f341459a06","observation_id":"65913de9-b905-4a15-910a-51ccf44688da","resolution":{"observed_at":"2026-08-15T21:01:39.635830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.616669Z","title":"Attention is all you need","venue":null,"work_id":"7c241388-44c4-47cc-b7c0-e76d6932b524","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.826010Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:17e2d29fe8ee9399ac9bb873fa5b3aa592d24b93b1f94609850a47ead1e74104","observation_id":"403d64ff-a537-4552-8f49-4041e217dbac","resolution":{"observed_at":"2026-08-15T21:01:39.621277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.601429Z","title":"Optimal transport: old and new","venue":null,"work_id":"2e51b488-78d1-4690-a341-80119d15582d","year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.831030Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:100a8203ffd20429222708b7ea6e7ade621456102530716324c1ea03f3cf55b2","observation_id":"db607275-2142-4af8-8dd8-14cb766e6385","resolution":{"observed_at":"2026-08-15T21:01:39.606340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.586928Z","title":"Learning to combine: Knowledge aggrega- tion for multi-source domain adaptation","venue":null,"work_id":"fa846bdb-2d10-4389-a7c7-fca96691d653","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.835846Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:2731c97786e2ad9bd85ca5d0d36529f1dec2605bb588d206b48a1767b8413df5","observation_id":"2dcf3c28-e99f-4ec3-ae7c-e8c33c20b304","resolution":{"observed_at":"2026-08-15T21:01:39.591726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-15T21:01:38.840420Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.840420Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ca9bbce3e6fce2c6edc16cf4b3be66aadb784b2b032723ae39fe89118f27a3a7","observation_id":"7c0b0f61-e2b7-46d9-bb19-459480b1a9e1","resolution":{"observed_at":"2026-08-15T21:01:38.840420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.572304Z","title":"Mvp: Multimodality-guided visual pre-training","venue":null,"work_id":"d3407d54-652e-479e-aab8-63287876f247","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.845368Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:da82aee7b7144ee2a4105fc116ae064827881ba4f0d6c6c5fd72e2bd384d9ae8","observation_id":"55b012a0-b38b-49f9-b321-51c4f2c794b8","resolution":{"observed_at":"2026-08-15T21:01:39.577128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-14T17:28:29.344751Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-15T21:01:38.849934Z","title":"Visual entailment: A novel task for fine-grained image understanding","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.849934Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:8118e8245f10ac6c26ed571ec27764201ba304e3c7b72655cc964e42897a62b7","observation_id":"deaa2c2d-f7ac-4aec-a500-d1e3e843a593","resolution":{"observed_at":"2026-08-15T21:01:38.849934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.557417Z","title":"A fast proximal point method for computing exact wasserstein distance","venue":null,"work_id":"46c2ce49-398c-407e-a06b-75647b284382","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.854916Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d167705f2dac38df0f90c2a383afe210f1c3065a8a907f21dd40fe6fbc26a567","observation_id":"35dd7e54-89fe-4315-8fb4-62c1fc13119e","resolution":{"observed_at":"2026-08-15T21:01:39.562192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.542881Z","title":"Vision-language pre- training with triple contrastive learning","venue":null,"work_id":"2668a5c7-15b9-4edb-bfa0-d8f6b74baff3","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.859498Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:027bb59eabec4d52022b8986004146d226f2b88313731bb0cc4cdc05fec2a2fd","observation_id":"9f1ffb73-0c4f-45eb-8907-460c0cd33c99","resolution":{"observed_at":"2026-08-15T21:01:39.547744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.528355Z","title":"Unified contrastive learning in image-text-label space","venue":null,"work_id":"f25beadc-a26d-4826-a1fd-83194aaebc81","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.864421Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:258e0374d0f9c06615c11af7cefcb2067ae221c5ed687500a304d0a66141ae51","observation_id":"89478e07-0d26-4164-881d-72924a471f13","resolution":{"observed_at":"2026-08-15T21:01:39.533274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-15T21:01:38.868708Z","title":"Filip: Fine-grained in- teractive language-image pre-training.arXiv preprint arXiv:2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.868708Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:706956e0616af90f87cc009af5271d9d2960b9616392442857cbcb9c82956c24","observation_id":"957b594d-6f13-47fe-96d9-93b44a7a7eb9","resolution":{"observed_at":"2026-08-15T21:01:38.868708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.513664Z","title":"FILIP: fine-grained interactive language-image pre-training","venue":null,"work_id":"450625eb-16b0-4cbd-a5e4-b62933328c0d","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.873663Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4b1ba5b70484dfb39457e3d7cae3829629ba819c07ce33fc5b27bdd0b19eeba6","observation_id":"5c558f01-be97-4bf8-aa03-68cd271fc20d","resolution":{"observed_at":"2026-08-15T21:01:39.518572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-15T21:01:38.878311Z","title":"Coca: Contrastive captioners are image-text founda- tion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.878311Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:9c1fda9eb09334ee3b4d35e15b3235673836bdddd0c259301e54e8efe6c6cb8c","observation_id":"132e1aec-03d9-42ba-a78b-d52284e19a45","resolution":{"observed_at":"2026-08-15T21:01:38.878311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:47:00.573887Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2505.11216."}