{"as_of":"2026-08-10T17:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f53008a4dcdc7522660ffcb0218c5ea5c58e5246f299438923fa1c3bd164741d","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:43:46.800172Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.12819/citation-record","integrity":"/paper/2602.12819/integrity","json":"/paper/2602.12819/citation-record.json","paper":"/paper/2602.12819"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.257162Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.257162Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:84583ea917b5d418984a83db69ef589112bc0ea9449cc14b91959f07a0fcbeb8","observation_id":"021ae899-4baa-4bc0-9168-34af7c51db8c","resolution":{"observed_at":"2026-08-02T23:43:45.257162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.388597Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.388597Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:4a9cea1eaad420761a6415309910090d9d8029ab2bb493b69b18e2143254d215","observation_id":"5b93d119-1f88-4297-90cf-08b8aaa71f56","resolution":{"observed_at":"2026-08-02T23:43:45.388597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.458802Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.458802Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:6a93ce3ca1459bcdf59c66a375ee45513bc53e93b43092854a87d853eac8fb38","observation_id":"df9131d5-5b57-499f-9163-72b70f80914c","resolution":{"observed_at":"2026-08-02T23:43:45.458802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-02T23:43:45.497421Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.497421Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:f761b3b380b44e19c8d4e3894468801ea3bb58f956248c60ebfb040384576399","observation_id":"689d7270-0652-4b89-bf99-361c09e2150e","resolution":{"observed_at":"2026-08-02T23:43:45.497421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.649786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.649786Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:4ed6fc2d368b68c030ea12d69ccdd60f74819446f2d641524094214664285e1e","observation_id":"8e4d268f-3ea7-473b-87a3-69f3946a7e2e","resolution":{"observed_at":"2026-08-02T23:43:45.649786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.876623Z","title":"Richard Hipp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.876623Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:42558df1720f01d369200253d26fab43a047c4cc6d26b5f6ae3b8a38929d857c","observation_id":"fd9847a4-2feb-4f2e-86be-18f58c7510ae","resolution":{"observed_at":"2026-08-02T23:43:45.876623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.982426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.982426Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:daa9155d7910da3fa426a8e4f3439a80db7bcb8d4faf5ccfa265c79cce9ccb06","observation_id":"1feb67a9-c110-4db3-980e-4962e5d6f67f","resolution":{"observed_at":"2026-08-02T23:43:45.982426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10552","last_updated":"2025-07-14T17:59:59Z","snapshot_observed_at":"2026-08-06T17:25:46.652752Z","submitted_at":"2025-07-14T17:59:59Z","title":"Self-supervised Learning on Camera Trap Footage Yields a Strong Universal Face Embedder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10552","snapshot_observed_at":"2026-08-02T23:43:46.074733Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.074733Z"},"links":{"cited_paper":"/paper/2507.10552","citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:2f28a3f2f7c5a8dc63b5b9735ea096a9b1e9aeafccd567a3996201ff986b271d","observation_id":"49fe1455-d905-454b-9c9e-8158a324db88","resolution":{"observed_at":"2026-08-02T23:43:46.074733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.17171361","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.OpenCLIP","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"37e26086-6dc0-47b9-a908-21aa2e1060ce","year":2025},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.179127Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:33ae7587df9924b22a58968fb51540b247a01d875876ee19ffeedf3a3e0ef71e","observation_id":"23416c91-db46-4a41-9d82-ebed4f11efa8","resolution":{"observed_at":"2026-08-02T23:49:46.777873Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:46.261990Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.261990Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:5fe3c9c9ce0346afc5cf5d023e50e15f3063d91229195add355c73614f5b0ce3","observation_id":"e3f9bcf6-e127-4ffe-a449-bd3635ff35be","resolution":{"observed_at":"2026-08-02T23:43:46.261990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:46.410470Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.410470Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:d13bb3766984aac3ae33acfbfec7cdee75dd4d1d3578386f613da9e156c80c94","observation_id":"e58d91f4-bb44-46db-8054-c68109bf47d5","resolution":{"observed_at":"2026-08-02T23:43:46.410470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:46.560074Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.560074Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:f6fafbe60496369c85b8209d57afd4a254329da02285e0b9df6eef6be174e97c","observation_id":"60857ee3-2044-40dd-bd74-31249b1dbabd","resolution":{"observed_at":"2026-08-02T23:43:46.560074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:46.800172Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.800172Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:55dfe40fbe08379fccc5fb7b8239ebf13505504cbaa78996cd2fb2d1904affd5","observation_id":"7a57b258-a45c-46b5-a8eb-008a09d74a5f","resolution":{"observed_at":"2026-08-02T23:43:46.800172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:46.688077Z","title":"In International conference on machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:46.688077Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:8890d9dc6d56eb1958d88d22cad42cb72982c2adc1eaf788ef15451de939a3f4","observation_id":"b7a94a39-aeba-4c33-93b0-0822f1cc5c54","resolution":{"observed_at":"2026-08-02T23:43:46.688077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:45.733030Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:45.733030Z"},"links":{"citing_paper":"/paper/2602.12819"},"observation_digest":"sha256:7c0f0a6a7abc9a6802137f4e468dffd2f304a8f83bc85904293380f2d8f3d35b","observation_id":"65c977d5-2f2e-429e-9424-d067a194053d","resolution":{"observed_at":"2026-08-02T23:43:45.733030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.12819","last_updated":"2026-06-01T14:45:05Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-02T23:43:44.849156Z","submitted_at":"2026-02-13T11:03:06Z","title":"WISE: A Multimodal Search Engine for Visual Scenes, Audio, Objects, Faces, Speech, and Metadata"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2602.12819."}