Highlights

id1030161932

The benchmarks, rising exponentially with each new model, seem to back this up. On Humanity’s Last Exam—a test of graduate-level reasoning—top models went from the low single digits a year ago to roughly 44 percent today. On GDPval—a test of how well frontier models perform real-world economic work versus humans—frontier models jumped from similar lows to about 85 percent. In May, METR, an AI safety research nonprofit, released an early Claude Mythos result showing that the model had an 80 percent success rate on tasks that would take a human expert about 4 hours to complete.

El Progreso exponencial de las capacidades de los LLM. Nota que contiene datos, evidencias, estadísticas, imágenes, metáforas y framings que muestran el vertiginoso avance de las capacidades de la IA.

→ Readwise


id1019849632

The new reality is the opposite—the more we automate, the more expert human work there is to do. Here’s why: AI commoditizes the residue of human expertise—whatever can be made explicit enough to train on. That collapses the value of default model output and creates demand for what’s different. Demand for what’s different is demand for human experts, even as we approach artificial general intelligence (AGI).

Los modelos reemplazan tareas, no el criterio experto Toda tarea digital que pueda traducirse en especificaciones por escrito, que declaren claramente qué se necesita hacer y cómo, es algo que puede ser ejecutado por un modelo de lenguaje. Lo que queda afuera de esto es el criterio experto, la comprensión del problema, el saber hacer las preguntas correctas.

→ Readwise


id1030163142

Work with AI is starting to settle into two very different modes(3). The first is the one the AI discourse predicted pretty well: agents as employees. These are agents you delegate work to. Some are agents that live in Slack, have names and jobs, and can be tagged when you want them to do something. Some are agents embedded in an ongoing workflow—like customer service—acting as always-on gatekeepers for repetitive tasks. The second mode is stranger and, in my experience, more important. It is human-agent collaboration in tools like Codex, Claude Code, and Claude Cowork. These are not just places where you hand off work. They are becoming operating systems for the work itself, where you and multiple agents use the same computer, at the same time, to do highly complex, original work that can’t be done by an asynchronous agent.

Diversos modos de caracterizar la relación con los agentes. Esto probablemente es una nota-hub, que apunta a distintas notas pequeñas donde se describen en más detalle cada una de las propuestas. En este caso, mi entendimiento parcial es que un modo es configurar un agente para una tarea específica y gatillarlo siempre que se requiera, mientras que el otro es utilizar el modelo de lenguaje como una cabina de control que te permite manipular varios procesos a la vez, pero no para resolver una tarea específica necesariamente, sino que para ayudar a pensar, definir, prototipar, iterar, etc. No sabría muy bien cómo llamarlo, me suena a la imagen del centauro, pero es claramente más compleja.

→ Readwise


id1030163759

you’re responsible for managing the agents at the start and end of each one of their tasks, making sure it’s done well, and finding the next piece of work to do. Kieran calls this the human “sandwich”—we’re the bread on either end of the AI’s work.

Sandwich humano (AI) Forma simple y graciosa de representar que uno siempre es el último responsable del trabajo que hace en colaboración con la máquina, y que la mejor forma de trabajar en conjunto es de manera bien estrecha, “con la correa corta”, al menos hasta que los procesos generados den cuenta de que se logra cierto nivel de efectividad y predictibilidad.

→ Readwise


id1030164371

Codex and Claude Code are becoming a new operating system for work.

IA Agéntica como un nuevo sistema operativo para el trabajo cognitivo (knowledge work). No sé si IA Agéntica es el mejor nombre, no sé cómo referirme en genérico a Codex, Antigravity, Pi, Claude Codex. Este es el nombre para el segundo tipo de interacción que dejé abierto en mi comentario más arriba. No sé si el nombre propiamente tal, pero sí el de una nota asociada.

→ Readwise


id1030164917

The further away an agent gets from a human who is in charge of making sure it works well, the less well it works.

Un agente funciona mejor con la correa corta. Esto, a propósito de tipologías de relaciones con los modelos, cómo caracterizarlas, y cuáles son más y cuáles menos recomendables. Es importante tener heurísticas que simplifiquen la presentación de ideas complejas o intuitivas, hacerlas explícitas en la línea de la redescripción representacional, esto las hace más manipulables y disponibles al cambio.

→ Readwise


id1030165320

Current language models are trained on the visible residue of human competence

En este mismo artículo hice un comentario sobre una idea parecida, creo que este debiese ser el título de la nota, ya que resume de manera muy elegante la idea central.

→ Readwise


id1030165700

Sameness creates a demand for difference Humans quickly learn when something is slop because of the internet. Any piece of work can instantly reach everyone else in the world, and often does. When too much of it starts to look the same, we smell a rat.

El encabezado es el título de la nota: “Más de lo mismo genera la demanda por la diferencia”. Es una idea que resume, por una parte, la lógica que explica la abundancia del slop y, por otra, cómo y por qué superarlo: diferenciarse, hacerse único, es una ventaja comparativa que muestra que uno no es simplemente del montón, que no es un cliché producto del uso indiscriminado de las herramientas (quien usa a quien?), sino que da cuenta de un uso preciso e intencionado.

→ Readwise


id1030166173

We demand not just any React app or research report—but one that feels exactly right for the person, company, and situation. We demand one that feels alive and specific, not cheap and generic. We want something that is more expensive—in terms of time or money—to produce than it is for us to consume. We want something that has status. And when new technology comes along that makes what used to be high status cheap, we’re very good at inventing new status games to match our new capabilities.

Este fragmento complementa al anterior como una bajada en ejemplos concretos.

→ Readwise


id1030166438

AI does not eliminate expert human knowledge work. It dramatically increases the volume of work being done, and none of that work is differentiated or valuable unless a human being is involved.

→ Readwise


id1030166622

regardless of your current job, there is a form of work that stays structurally ahead of the models—using them to address today’s problems as you see them. That’s where knowledge work is headed.

El rol de la expertise en la época IA. Creo que es una nota que probablemente ya está creada de alguna manera. Apunta a la idea de que él compute de los modelos de lenguaje es genérico y está comoditizado, es decir, disponible para todos. Lo que hace que algo destaque en un ambiente en que la marea sube por igual para todos (en el sentido de la capacidad de generar cierto tipo de trabajo intelectual o cognitivo) es la capacidad de utilizar estas herramientas con criterio, intención, pulcritud y estilo.

→ Readwise