{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:232dff467c9de604e80d236248872bfe80fccbce757c16430aab770a2437d631","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:57:12.636325Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:57:12.479732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T14:57:12.816902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06631","snapshot_observed_at":"2026-08-08T14:57:12.816902Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","venue":"cs.CV","work_id":"02a51316-af6c-4d39-9a0b-2bc916d0d7d3","year":2025},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.479732Z"},"links":{"cited_paper":"/paper/2502.06631","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:58e3b0d3b427efa4fda738117d5cc3a3e17a8ffa833b87b6186d7fdada156b99","observation_id":"0696ad96-3d03-4398-baa9-416714377ac5","resolution":{"observed_at":"2026-08-08T14:57:12.824486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06631/citation-record","integrity":"/paper/2502.06631/integrity","json":"/paper/2502.06631/citation-record.json","paper":"/paper/2502.06631"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2502.06631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06631","snapshot_observed_at":"2026-08-08T14:57:12.816902Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","venue":"cs.CV","work_id":"02a51316-af6c-4d39-9a0b-2bc916d0d7d3","year":2025},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.479732Z"},"links":{"cited_paper":"/paper/2502.06631","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:58e3b0d3b427efa4fda738117d5cc3a3e17a8ffa833b87b6186d7fdada156b99","observation_id":"0696ad96-3d03-4398-baa9-416714377ac5","resolution":{"observed_at":"2026-08-08T14:57:12.824486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.264276Z","title":"Conformal Predictions Providing reliable confidence estimates for predictions made by deep learning models is essential in many applications","venue":null,"work_id":"37651488-6881-437e-a94d-14b273381149","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.486097Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:f44353b63c0fb1d3154453b37e5d8ee16bae119606c51ab77aad5d1c4c247499","observation_id":"14ddd180-af64-41a0-8915-b6c19d18bcd8","resolution":{"observed_at":"2026-08-08T14:57:13.269711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.248182Z","title":"Experimental settings We conduct our experiments using three video clip datasets: HMDB51 (51 classes) [23], UCF101 (101 classes) [24] and Kinetics400 (400 classes) [20]","venue":null,"work_id":"93f02b02-840c-4782-b610-69c90bc9a827","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.491485Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:ccfe35c3d5695d4003ef95b0ba519857ab4b692e029c608714c9107d05e0a722","observation_id":"937c3d2d-80a0-4e38-ba04-34cc503621e2","resolution":{"observed_at":"2026-08-08T14:57:13.253420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.216730Z","title":"Red dots mark 1/τ∗, our estimate for minimizing tail size, while green dots indicate the true optimum 1/τopt when it differs","venue":null,"work_id":"5427ba3e-881c-40e1-8ff6-2aa494a3bd21","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.502192Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:a8e4804742a1916a1f3f3f0733877fcd3d60244d6e596908ed80f467004c23e8","observation_id":"a4dc4bf8-b50e-4c10-974f-14b4c4860548","resolution":{"observed_at":"2026-08-08T14:57:13.222306Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.200992Z","title":null,"venue":null,"work_id":"929cd8b6-fa27-4969-9829-2c73269644bc","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.507668Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:6f0f28fdb45eb33c6d62506ff2077a01f84042f5d885f84bf3cf1b8593a3146b","observation_id":"d271ec38-87e0-4102-b171-7f46843b75e1","resolution":{"observed_at":"2026-08-08T14:57:13.205996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.103373Z","title":"Behavior recognition via sparse spatio-temporal features,","venue":null,"work_id":"30ff5447-ac20-46d7-9ce4-822873623e47","year":2005},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.538451Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:6c52846d631b5ace8b1aa18e3ee3ba31eff3ecef0f1478f6c4ee1fc2d8bc53ba","observation_id":"26d32a1e-c5df-4c3a-9808-2337a5e9288e","resolution":{"observed_at":"2026-08-08T14:57:13.108366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.184900Z","title":"Fast user-guided video object segmen- tation by interaction-and-propagation networks,","venue":null,"work_id":"5c93937b-f09f-465f-8206-e1921b59b6e6","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.512849Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:d09631d6212ad87db87cad6b487beeca74dd9a93b61ad16ae033bfb230e9fc5c","observation_id":"e53a7350-a19a-46af-bf66-01c5b696be03","resolution":{"observed_at":"2026-08-08T14:57:13.190000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.168751Z","title":"Human-in-the-loop vehicle reid,","venue":null,"work_id":"b91c05f8-6a0c-4b67-bf48-a767513f9051","year":2023},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.517839Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:09cfaf89ecdcbaedd80f10899424ba387ebde4c2d9009fef126efa08049da12c","observation_id":"d623cd3e-30ec-4323-b602-6198080154fa","resolution":{"observed_at":"2026-08-08T14:57:13.173741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.153019Z","title":"Surveillance video querying with a human-in-the-loop,","venue":null,"work_id":"45af1b8a-cc5f-4e74-904e-f74e40382fbc","year":2020},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.523018Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:6a90bc05411dda79b7b2b501fd18b7a5382f38b6d50a321be5d4368a18349d2c","observation_id":"db002e33-79c5-412c-be50-1a43bcc1e030","resolution":{"observed_at":"2026-08-08T14:57:13.157968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.135560Z","title":"De- signing decision support systems using counterfactual prediction sets,","venue":null,"work_id":"73c05a54-036c-4039-9414-98e51693d99a","year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.528008Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:e71232ec8937e09ced4882e723145ee941570488231b1868afb3bc08b176f077","observation_id":"2bf64a99-9bb0-400a-8ffc-ef1fb4a94a89","resolution":{"observed_at":"2026-08-08T14:57:13.140776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.119505Z","title":"Conformal prediction sets improve human de- cision making,","venue":null,"work_id":"b6f5bc0b-974c-4dcc-a742-f1158d906e05","year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.532984Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:9f3aba05bda46497950791e53ce1262643c88c72f0e7a5620616b548624e55ef","observation_id":"983ee99c-06c2-4e4e-a30d-dc7291c60a6e","resolution":{"observed_at":"2026-08-08T14:57:13.124735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.021785Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":"2619a314-8c7f-4445-ad41-c7268e1b997a","year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.568095Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:514ec59aa1ae8c6e7b553ade8e26d4c5802d7de8a2137e8a270a1ee4a02b1ca1","observation_id":"b0c089b6-f903-40ce-836e-ad89ca43de0b","resolution":{"observed_at":"2026-08-08T14:57:13.027326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.087251Z","title":"Temporal segment networks: Towards good practices for deep ac- tion recognition,","venue":null,"work_id":"1c356c38-7895-4e5e-9d9f-513c3a4ce4bf","year":2016},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.543548Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:338c05a79698767bb9ef1b712e3c5602f345be8fa7606c007db9836a00dd4a76","observation_id":"e0520cae-d70e-437d-9a80-e678ddd82761","resolution":{"observed_at":"2026-08-08T14:57:13.092733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.071271Z","title":"Slowfast networks for video recog- nition,","venue":null,"work_id":"ef337d24-c577-48f7-8e5b-01e760b8688c","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.548509Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:c48fd89085788fea50896ecf12d428f70725646e8a705c534e663cb53f417fe1","observation_id":"40a9001d-cfa5-414b-892c-87b68362b7ef","resolution":{"observed_at":"2026-08-08T14:57:13.076522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.054883Z","title":"Stm: Spatiotemporal and motion en- coding for action recognition,","venue":null,"work_id":"ed3521aa-1bf6-44d3-9457-72a881854523","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.553338Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:a87201a34381442cc194dffefce3c11f059f00e64643bd012e3540d0c8dc732a","observation_id":"f5c9e6ea-c327-487b-b214-588895d3b2a0","resolution":{"observed_at":"2026-08-08T14:57:13.060036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.038698Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"a6dcc7b5-93b3-46b0-9e97-8aa39ff051cf","year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.558219Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:c306718a6fbaeda72603f382f686e9bf69cbdacc405378c1c9674c33585c8730","observation_id":"1c500f2c-4430-4e4f-8aa2-aea9dcb298ac","resolution":{"observed_at":"2026-08-08T14:57:13.043979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-08T14:57:12.562855Z","title":"Ac- tionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.562855Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5e7c29d70dbdec4fae7be54508e8fa8d1ca7ae7f0f524ce00131b99043f38fc8","observation_id":"db75da33-556d-40dd-8625-aa56000599e1","resolution":{"observed_at":"2026-08-08T14:57:12.562855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.939433Z","title":"An electronic nose-based assistive diagnostic prototype for lung cancer detection with conformal prediction,","venue":null,"work_id":"2eb78dc7-2a41-43a4-ae5a-89c708ed9462","year":2020},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.597946Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:ca6b715b8b3c7f38258c2f340350fa6ff600e7bea4bef42f70964c25ae74b96a","observation_id":"7f5472a1-8231-4ad2-ba2e-fc17ed0bcccf","resolution":{"observed_at":"2026-08-08T14:57:12.944526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.572903Z","title":"Are foundation models for computer vision good conformal predictors?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.572903Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:dc316b4a5d359fcf312014a2ab1540e0e0bd6d65a9ba69bb8a5c90a129483208","observation_id":"b923805b-bfda-4892-b4ee-f3ecc20ef08e","resolution":{"observed_at":"2026-08-08T14:57:12.572903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.005752Z","title":"On the rate of gain of information,","venue":null,"work_id":"e9c2cb82-54ca-4004-a822-605a9e992946","year":1952},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.577660Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:6897c89394f2ba320431a042232412fa22a0780d35b47167756b96738436ca05","observation_id":"1ed4e0fd-0643-484b-98cf-27143aa82821","resolution":{"observed_at":"2026-08-08T14:57:13.010707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.988672Z","title":"Selection from alphabetic and numeric menu trees using a touch screen: breadth, depth, and width,","venue":null,"work_id":"61e6ce90-93fc-43a4-a0dc-521f860adef6","year":1985},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.583346Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:35fc95e3e7035b16d654728159d3a235b84bb5b28e1b11fe82f3649097a1525d","observation_id":"a24f7d33-6532-45e0-b602-fb6ae52e3661","resolution":{"observed_at":"2026-08-08T14:57:12.994010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.972649Z","title":"29, Springer, 2005","venue":null,"work_id":"3b87203d-9594-4eec-bd2f-9be16ea4747e","year":2005},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.588442Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:fcab07d5034996f9bcbe98453de1ec7d47484d4810606562b2807c4718150ef3","observation_id":"da4e27eb-11d8-4d45-bc02-038e32f85a63","resolution":{"observed_at":"2026-08-08T14:57:12.977618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.955300Z","title":"Least ambiguous set-valued classifiers with bounded error levels,","venue":null,"work_id":"45c179f2-cc79-42ca-84e3-ff5d8a8de4e6","year":2019},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.593351Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:de305cf5300a84e9196386d7cdfa09123097269b1155582fecb19b7966a52640","observation_id":"721a98cc-f580-44f3-ad99-72371ade35c7","resolution":{"observed_at":"2026-08-08T14:57:12.961553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-08T14:57:12.626354Z","title":"Ucf101: A dataset of 101 human ac- tions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.626354Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:547d16ce8309bd1ae707d5d748b7be4ea47c4592200f39c8244b33be4e4caae3","observation_id":"6646e6a3-2c74-42a6-8ec3-0cdf63832d99","resolution":{"observed_at":"2026-08-08T14:57:12.626354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:13.233016Z","title":null,"venue":null,"work_id":"e175b76d-4ad9-44ea-8d16-f5a06fe2b637","year":null},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.496797Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:c9a48f970493732099c11987d3bcf5c2d14460edebef76a4586f1b0f54e95fed","observation_id":"e8f59025-c1f8-483f-9807-cf3da5364aad","resolution":{"observed_at":"2026-08-08T14:57:13.237883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.923466Z","title":"Dense trajectories and motion bound- ary descriptors for action recognition,","venue":null,"work_id":"00d90a36-38c7-4ec1-819b-5d55638da6ec","year":2013},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.602719Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:d9a0404e12f5a228b5cc90598b936125471dc58ea85bfcce4fccb933dce49984","observation_id":"b09704fd-e233-4b1d-a05d-12750ded83d7","resolution":{"observed_at":"2026-08-08T14:57:12.928675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.904915Z","title":"Quo vadis, ac- tion recognition? a new model and the kinetics dataset,","venue":null,"work_id":"64e76724-5e6f-4873-bc63-97187bd22c97","year":2017},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.607464Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:576684cf761a7b24b473fff1a316ed256c697b017c2c93f52813ed07455eb884","observation_id":"bf0d9c6c-9e8d-4b62-9611-04c033e18da2","resolution":{"observed_at":"2026-08-08T14:57:12.910729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.888196Z","title":"Expanding language-image pre- trained models for general video recognition,","venue":null,"work_id":"e014b84c-573c-49ab-b42c-024f53d82ae6","year":2022},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.612212Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:89bae3133ff8f0e102fef61682c438d1bffc5ef8160f5fd86b6055f6beff0fc3","observation_id":"0eea96b6-72fb-453c-84f4-41be3bb39538","resolution":{"observed_at":"2026-08-08T14:57:12.894085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.871175Z","title":"Fine-tuned clip models are efficient video learners,","venue":null,"work_id":"ef77430a-52b8-438d-9663-d91a66434580","year":2023},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.616854Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:504b8ce5933821444c3e9101c40e7503e98b5c3ba59e676f5c8297def71b4ece","observation_id":"da2774e8-bb9f-449c-a0f4-21fb6629e4d9","resolution":{"observed_at":"2026-08-08T14:57:12.876493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.853684Z","title":"Hmdb: A large video database for human motion recognition,","venue":null,"work_id":"666bb78b-6733-45c5-a6d8-f95990711796","year":2011},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.621764Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:031ed4097688c7f983b2c270cfdc6342dc7ba16ea8691b04bb6eb707eb4dcc6c","observation_id":"68c96306-e637-4d2b-8e1e-a2fb307bdab1","resolution":{"observed_at":"2026-08-08T14:57:12.858847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:57:12.836825Z","title":"On sequence learning models: Open-loop control not strictly guided by hick’s law,","venue":null,"work_id":"40946708-f510-4b34-88ea-b98354f16fd5","year":2016},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.631485Z"},"links":{"citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:b8e3da9461f42e70180f49df73e072b0f3a3a050b7f59296458d6d19b3de2a42","observation_id":"3f56ef6a-da66-46bb-ae9a-b5593bf1c613","resolution":{"observed_at":"2026-08-08T14:57:12.842209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-08-09T19:13:53.289650Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-08T14:57:12.636325Z","title":"Eva- clip-18b: Scaling clip to 18 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.636325Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:cb75e79087078dbf9bb86f03dc1e1d275f31a7f7d4e6321eff48479e2f0f1aa2","observation_id":"6bf53bbe-ea34-459b-95a4-8b2c145abedf","resolution":{"observed_at":"2026-08-08T14:57:12.636325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2502.06631."}