{"as_of":"2026-08-10T03:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aad3e0f25fcad4adbb6869a528c06672251a2eaeac36d8cfa05858768b8de578","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:45:46.182206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:43:28.559460Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"reference_index":201,"source":"arxiv_source","source_observed_at":"2026-05-17T03:27:58.952076Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2310.01852"},"observation_digest":"sha256:410a6d4fda7636cf9d36d23a7a615da1cd08d99363b07a8a213761af993183da","observation_id":"094c9896-949c-45d8-8035-c54f68d97a4b","resolution":{"observed_at":"2026-05-17T03:27:59.100370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-08T15:45:46.182206Z","title":"Meta-transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06355","last_updated":"2025-07-08T21:12:11Z","snapshot_observed_at":"2026-08-09T15:41:37.561405Z","submitted_at":"2025-02-10T11:10:41Z","title":"Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:46.182206Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2502.06355"},"observation_digest":"sha256:7c9c2d0ecc389562ffde08ee1eabf106e17aa5bb8910bdc3273284c4508c5cd1","observation_id":"b28a1464-fd51-485c-b3ce-5993f5cd603c","resolution":{"observed_at":"2026-08-08T15:45:46.182206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T18:51:10.466981Z","title":"Meta-transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.466981Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:9fdb48b09ba511b925f8b1eea6198f9cd7d8281eb91ed18e201a5b438735b4a0","observation_id":"7d3b72f3-9ac3-47dc-971f-7913d16d98b5","resolution":{"observed_at":"2026-08-07T18:51:10.466981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T15:02:56.782916Z","title":"Meta-transformer: A unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-07T14:55:11.946052Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:56.782916Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:7bdb6b5ced26df0d4ac57c3597cfe6a2128f6b81d95f5127dfba87448d2feb13","observation_id":"bf6a3967-dc8c-4814-90ad-81b871184152","resolution":{"observed_at":"2026-08-07T15:02:56.782916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T14:19:16.348830Z","title":"Visible- thermal uav tracking: A large-scale benchmark and new baseline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19434","last_updated":"2025-05-26T02:53:12Z","snapshot_observed_at":"2026-08-09T15:43:01.159119Z","submitted_at":"2025-05-26T02:53:12Z","title":"CSTrack: Enhancing RGB-X Tracking via Compact Spatiotemporal Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:16.348830Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2505.19434"},"observation_digest":"sha256:ff852ee061c1bcbada656529843260509ad39a47a0a1cc6c10a1904e5e1f4757","observation_id":"5eb4434e-ca3b-48c6-981e-c21030d14ef3","resolution":{"observed_at":"2026-08-07T14:19:16.348830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T05:08:31.058312Z","title":"Zhang, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08774","last_updated":"2026-06-28T14:38:32Z","snapshot_observed_at":"2026-08-09T15:02:40.844890Z","submitted_at":"2025-06-10T13:16:26Z","title":"Multimodal Representation Alignment for Cross-modal Information Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:08:31.058312Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2506.08774"},"observation_digest":"sha256:05b9cd2c87793adb3f641ae5d050c53985ec27e7669093db5330d69292978a77","observation_id":"03313ad1-34f4-45bd-87f8-5a4fd52734b5","resolution":{"observed_at":"2026-08-07T05:08:31.058312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T04:41:03.961669Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09952","last_updated":"2025-06-11T17:23:21Z","snapshot_observed_at":"2026-08-09T18:06:17.997902Z","submitted_at":"2025-06-11T17:23:21Z","title":"UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:41:03.961669Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2506.09952"},"observation_digest":"sha256:e365a701e7fd3b503304fab43c5ba13f82149d2fb16f6ef98622a77917deeacf","observation_id":"073e77fb-ad37-4dd2-97d6-dd1e769597b4","resolution":{"observed_at":"2026-08-07T04:41:03.961669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T04:44:05.332988Z","title":"Meta-transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T21:45:10.885875Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":204,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.332988Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:1fe73219c50419c4b46ccb673d261c8ce0e793549c6774d52c5dd2f53f7004d0","observation_id":"999da810-be2a-47f6-a707-6f033554932b","resolution":{"observed_at":"2026-08-07T04:44:05.332988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T00:34:24.785026Z","title":"Meta-Transformer: A unified framework for multimodal learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:24.785026Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:7d5a0a78fdbee359383a41da05a1cabafbc0e87371ded3214ce494536b1f3040","observation_id":"e1b352cc-fa26-4045-88c2-71c9d46df71c","resolution":{"observed_at":"2026-08-07T00:34:24.785026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T20:25:32.736057Z","title":"Meta-transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02771","last_updated":"2025-07-03T16:34:34Z","snapshot_observed_at":"2026-08-09T00:45:22.366107Z","submitted_at":"2025-07-03T16:34:34Z","title":"Grounding Intelligence in Movement","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:32.736057Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.02771"},"observation_digest":"sha256:533c417c28dbfb5b74b9d3331c7048418a40de2f3a947d5def56402e5c4f4ed8","observation_id":"a5bb0568-c375-4117-9572-1c43c69c6999","resolution":{"observed_at":"2026-08-06T20:25:32.736057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T19:50:24.267156Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-09T15:11:32.122204Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.267156Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ef305178a65d440a97f6ff4533f7f49bad81ad3fbf3cc5a769f9219cc5b58143","observation_id":"af7aa99d-b892-47ac-a506-e0154c640fe8","resolution":{"observed_at":"2026-08-06T19:50:24.267156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T16:21:14.242806Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13812","last_updated":"2025-07-18T10:44:22Z","snapshot_observed_at":"2026-08-06T16:13:49.198903Z","submitted_at":"2025-07-18T10:44:22Z","title":"SkySense V2: A Unified Foundation Model for Multi-modal Remote Sensing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:21:14.242806Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.13812"},"observation_digest":"sha256:a303be60c8c164782b61f83c501119676f31d177d9e87ab2134711938889f4a8","observation_id":"bb67f243-f6f9-4431-a34b-1e7889d8cf85","resolution":{"observed_at":"2026-08-06T16:21:14.242806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T15:06:24.737211Z","title":"Meta- Transformer: A unified framework for multimodal learn- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16946","last_updated":"2025-07-22T18:35:50Z","snapshot_observed_at":"2026-08-08T12:05:57.381919Z","submitted_at":"2025-07-22T18:35:50Z","title":"Toward Long-Tailed Online Anomaly Detection through Class-Agnostic Concepts","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:06:24.737211Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.16946"},"observation_digest":"sha256:5a24966ed258ac1075a931bf3508890cf28b2714d62a3f5f5b34e9d830af3d32","observation_id":"a81cb44e-c014-4261-ba5b-b64825c1889b","resolution":{"observed_at":"2026-08-06T15:06:24.737211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2509.18169","last_updated":"2026-04-20T12:46:48Z","snapshot_observed_at":"2026-08-08T13:52:21.955742Z","submitted_at":"2025-09-17T10:15:25Z","title":"PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T16:05:57.505355Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2509.18169"},"observation_digest":"sha256:375cca2c78cabf43c8a9b767317947eea1a873e418e442ed31798be97fca7821","observation_id":"8da0476f-1283-4e1f-a0f4-4179457ab785","resolution":{"observed_at":"2026-05-18T16:06:34.928800Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2604.05704","last_updated":"2026-04-08T05:42:25Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:04:23Z","title":"QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:47.812339Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2604.05704"},"observation_digest":"sha256:c62ad241d14d704641e54738c968bceef84b564420ba1a3094e46e781987a437","observation_id":"95e42abf-9c27-4b0d-afb5-a5db37cc3d07","resolution":{"observed_at":"2026-05-10T23:30:50.439578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2605.16639","last_updated":"2026-05-15T21:12:17Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T21:12:17Z","title":"MedMIX: Modality-Internal Expert Fusion for Multimodal Medical Diagnosis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:38:56.999644Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2605.16639"},"observation_digest":"sha256:8a8d4a42c29c450d4b80f56a18c9af3440201fc6054f6a09dbce69e79b27dc0d","observation_id":"c7895d85-750b-4ae9-8d65-2a04bb2e1486","resolution":{"observed_at":"2026-05-20T19:43:44.196528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:b8f2f032c366d7bd8739ba2eb92ee963cc6b1a02268c8282a7b82570dca1b7c0","observation_id":"2e4e840f-7192-4aac-80fa-7d2c87bfc363","resolution":{"observed_at":"2026-05-20T10:43:12.558257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2605.28809","last_updated":"2026-05-27T17:58:16Z","snapshot_observed_at":"2026-08-06T17:56:08.806799Z","submitted_at":"2026-05-27T17:58:16Z","title":"AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:50.250899Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2605.28809"},"observation_digest":"sha256:e1740f8e06ae6cee96eeec163124b72f0752099ffebb1752a37ce2ddbd3ab47c","observation_id":"746ca5dc-4c1f-4614-b2aa-0a2feab58d3e","resolution":{"observed_at":"2026-06-29T13:43:28.561098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Meta-transformer: A unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-08-09T15:42:44.711926Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:13216b793aeab353487f39177f7ba69671b3c191bdd43dbab8b23a5097ef9d5d","observation_id":"d9ed1494-8d8a-42e7-9ef6-8ce8174919a0","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.10802/citation-record","integrity":"/paper/2307.10802/integrity","json":"/paper/2307.10802/citation-record.json","paper":"/paper/2307.10802"},"outbound":[],"paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:42:33.894056Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2307.10802."}